中新网上海新闻7月31日电(郑莹莹)如何让人工智能技术更贴合场景、加速落地应用?沪上科技企业近期动作频频。上海正坚持应用牵引,建设虚实融合实训场、行业基座大模型等基础底座。
基于具身模型信息密度定律与环境式数据采集方案2.0,并依托环境式采集引擎ACE,大晓机器人近日联合南洋理工大学S-Lab开源L5级多模态具身物理智能数据集ACE-Data-0。

ACE-Data-0包含150小时数据、1700万帧视频、200个任务类别、50名参与者、2个真实家庭场景和7.5万个交互片段。
打开橱柜、倒水、叠衣服等日常行为,同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉和任务规划。普通视频可以记录发生了什么,却难以准确呈现接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的关系。据介绍,ACE-Data-0不再把活动切割成孤立短片,而是连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程。
基于ACE-Data-0,大晓建立了底层信号推断、场景组成要素恢复、具身交互理解这由底向上的三级具身感知评估基准。研究团队进一步评测了30多种代表性方法。结果显示,现有模型在接触、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显能力缺口。
这套基准不只判断任务最终是否成功,更试图回答:模型究竟在哪一步失效?分层评测将问题拆解开来,帮助研究者判断模型已经理解了什么,又在哪一层发生能力断裂。
“ACE-Data-0”中的“0”代表这套具身数据体系的起点。未来,大晓机器人将继续围绕具身数据引擎、通用具身基础模型、世界模型和 VLA 推进研发。
在数据能力稳步积淀的同时,模型端亦有新动向。上海另一家企业智元自研的具身原生全模态大模型WITA-Omni Preview近日在行业知名榜单DailyOmni的最新评测中,以85.21分的综合成绩登顶。
对具身智能机器人而言,“理解”和“回应”并不是两个割裂的步骤,而是一个持续发生的物理过程。机器人需要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中,它还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。
据介绍,WITA-Omni并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从Thinker-Talker范式上进一步扩展出面向具身输出的Thinker-Talker-Actor 架构。
依托WITA-Omni 构筑的交互智能底座,智元将进一步夯实技术架构,与作业智能、运动智能协同联动,持续解锁商业、公共服务、影视展演等场景。
根据《上海市具身智能产业发展实施方案》,上海计划到2027年,实现具身模型、具身语料等方面核心算法与技术突破不少于20项。上海主要从坚持模型驱动、打造算力等公共平台、支持应用示范标杆、发挥群链集聚效应、完善发展生态几个方面来推动具身智能的发展。(完)
注:请在转载文章内容时务必注明出处!
编辑:王丹沁






