이는 여러 이점을 제공합니다. 어노테이터 간 편차가 없고, 지게차를 트럭으로 잘못 라벨링하는 식의 데이터 세트 내 라벨 불일치도 발생하지 않으며, 비용이 많이 드는 품질 관리 과정도 필요하지 않습니다.
또한 경제적 효과도 분명합니다. 합성 데이터를 활용한 훈련 시뮬레이션은 대규모로 수행할수록 이미지당 비용을 크게 낮출 수 있습니다.
대부분의 인식 파이프라인에서 합성 데이터가 수작업 라벨링보다 비용 효율적이 되는 시점은 예상보다 훨씬 빠르게 도달하며, 보통 수만 장의 이미지 수준에서 발생합니다.
대부분의 로보틱스 모델이 수백만 장의 이미지를 필요로 한다는 점을 감안하면, 합성 데이터를 선택하는 것만으로도 상당한 비용 절감 효과를 얻을 수 있습니다.
이러한 변화는 시장에서도 분명하게 나타나고 있으며, 합성 데이터는 AI 훈련 파이프라인의 핵심 요소로 자리 잡을 것으로 전망됩니다.