这带来了多项优势,例如:消除标注人员之间的分歧;数据集中不会出现不一致标签(例如将叉车标为卡车);省去成本昂贵的质量控制流程。
更重要的是,它带来了显著的经济效益:大规模使用合成数据进行训练模拟,可以显著降低每张图像的成本。就大多数团队的感知管线而言,其实用不了多少数据(大概几万张图),使用合成数据就已经是比人工标注更划算的选择了。
由于大多数机器人模型需要数百万张图像,这意味着选择使用合成数据可以省下巨额成本。
我们从市场信号中也能清楚地看到这一点——合成数据预计将成为AI训练流水线中的重要支柱。