当前位置: 主页 > 快讯 >   正文

机器人开始向更多人类买数据

导读:机器人开始向更多人类买数据

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:贝壳财经)

为了让机器人更快地“为人所用”,具身智能公司选择把数据采集进一步交给普通人。

今年8月,美国人形机器人公司Figure公开数据采集项目Index。隐身运行4个月,Index已覆盖108个国家,用户累计上传1600万段视频;9月,觅蜂科技也发布物理AI数据众包服务平台“觅蜂派”,将数据采集进一步延伸到家庭、零售、餐饮、制造等真实场景。

众包模式(指借助互联网等手段,将传统由特定企业和组织完成的任务向自愿参与的广泛企业和个人进行分工)兴起的背后,是具身模型的数据需求正从万小时迈向百万乃至千万小时,并且对真实世界数据的规模和多样性提出更高要求。

但当采集者从少数专业人员扩展到数万名普通用户,如何把大量分散、非标准的数据,持续加工成模型真正可用的训练材料同样是不小的考验。

数据采集走进寻常百姓家

和人相比,机器人对真实世界的经验还远远不够。

过去,机器人数据大多在固定场地集中采集,但在同一个房间把杯子拿一万次,与在一万个不同厨房、商店、仓库中各拿一次杯子,对通用具身模型训练的意义并不相同。

Figure在推出Index时提到,公司此前曾尝试向外部数据供应商采购数据,但供应商无法满足Helix对于吞吐量、多样性和质量的要求,因此决定自建采集网络。

“过去大家都在做家庭场景,都在叠衣服,但是叠衣服数据已经泛滥了,大家可能需要更专业的数据,比如修水管、修车、理发、美甲这些技能需要一个个去点亮。”作为数据供应商,觅蜂科技董事长兼CEO姚卯青同样感受到需求端的变化,客户对数据的需求已经不是简单地堆量,而是越来越走向更细分和专业的赛道和技能。

为此,二者采取了一个共同的办法,把数据采集的任务分散到生活、工作在不同环境中的每一个不同个体手中。

Figure披露的数据显示,上线4个月,Index已有26.4万次下载,覆盖108个国家,拥有超过4.4万名周活跃贡献者,累计上传1600万段视频;平台每秒接收约30分钟新视频,已向贡献者支付1500万美元。

任务范围足够宽泛,每1000小时Index数据,平均包含373个不同任务、1146个操作对象和116个环境,从家庭中的烹饪、清洁、洗衣,到物流中心、餐厅、工厂和办公室中的工作,再到清理猫砂、更换机油等琐碎任务,都在Index的采集范围之内。

觅蜂派则试图用“场景网络”和“人群网络”解决这个问题,前者连接酒店、餐饮、商超、物流、工厂、医疗、家庭、养老等真实环境,后者连接不同行业和地区的参与者。

根据觅蜂派公布的数据,目前平台覆盖22大类场景、5000多个任务和5万个以上真实环境;内测一个月,注册用户达到2万人,累计产生1.3万份采集任务提交。

数据采集众包背后更直接的驱动力来自模型训练的数据需求正在迅速增加。

姚卯青在接受采访时谈到,去年上半年,机器人行业很少有人提几十万小时规模的数据,很多都是一万小时规模,到去年年底有人已经到20万小时,今年很快有人提出100万小时的规模量,“实际我们接触到的用户已经提出千万小时的需求。”

而当数据需求从万小时走向百万乃至千万小时,仅依靠固定基地增加机器人、操作员和场地,越来越难线性扩张,众包则提供了另一种可能,让采集设备和任务直接进入原本就存在的真实世界。

众包加速数据采集走向工业化

众包打开了真实世界的数据入口,但Figure和觅蜂选择了不同的数据采集路径。

从Figure已披露的信息看,Index主要采集人类完成真实任务的视频。这类数据采集门槛相对较低,更容易快速扩大样本规模,并覆盖更多场景、任务和行为方式。

但全球创作者每秒上传约30分钟内容,海量众包数据也把压力转移到了后台。

在具体处理环节,Index设置了筛选、作弊审核、去重、再平衡和标注五道流程。系统首先从技术质量、画面质量和语义质量等方面进行自动筛查,再由人工对异常用户和可疑样本进行审核;同时,为了避免大量相似内容反复进入训练集,Figure还会提取每段视频的特征并计算相似度,剔除重复度较高的数据;随后结合任务配额和内容聚类重新调整不同类型数据的占比,最后为每段数据生成层级化的文字描述。

觅蜂则希望在扩大场景覆盖的同时,把人的行为记录成带有空间、轨迹和多模态信息的数据。

参与者需要佩戴MEgo专用数采设备,记录第一视角和多视角视觉、毫米级位姿,以及触觉、力觉等多模态信息,之后再由MEgo Engine完成数据处理、标注、轨迹提取、质量评价和交付。

姚卯青介绍,MEgo使用专业双目摄像头,一方面便于Slam去提取高精度空间信息做标定;另一方面也可以做深度提取,同时还需要腕部相机捕捉手部细节,标注层面则要求毫米级空间精度。

由此可见,Figure和觅蜂选择了两条众包采集路径,但也面对同一道题:当数据采集从少量专业人员扩展到数万名普通用户,真正的门槛已经不只是“能不能采到”,而是能否把高度分散、非标准化的数据,持续加工成稳定、可用的训练数据。

中国信息通信研究院人工智能研究所具身智能与机器人部副主任张蔚敏表示,众包数据平台的价值,不只是汇集大量记录,更在于通过任务组织、数据工程、质量控制和闭环运营,将分散的数据转化为可训练、可评测的数据资产。

众包扩展了具身智能的数据边界,但它最终能否成为一种稳定的数据生产方式,仍然取决于平台能否把分散的人类经验,转化为可规模化交付的训练数据。

新京报贝壳财经记者 张晓慧

编辑 岳彩周

校对 翟永军

声明:市场有风险,投资需谨慎。本文基于第三方数据库发布,不代表本网观点,任何在本文出现的信息均只作为参考,不构成个人投资建议。如有出入请以实际公告为准。

热点新闻