Isso traz diversas vantagens: elimina divergências entre anotadores, evita inconsistências nos rótulos do conjunto de dados (como uma empilhadeira classificada como caminhão) e dispensa um ciclo caro de controle de qualidade.
Além disso, o impacto econômico é claro. O uso de dados sintéticos para simulações de treinamento reduz significativamente o custo por imagem quando aplicado em escala.
Para a maioria dos pipelines de percepção, o ponto em que dados sintéticos se tornam mais econômicos do que a anotação manual chega muito antes do que se imagina, muitas vezes após apenas dezenas de milhares de imagens.
Como a maioria dos modelos de robótica exige milhões de imagens, optar por dados sintéticos pode gerar economias substanciais.
Esse movimento já é evidente no mercado, os dados sintéticos estão se tornando um componente dominante nos pipelines de treinamento de IA.