随着通用大模型逐渐掌握三维环境的理解、操作任务的拆解和机器人控制能力,具身智能领域的公司是否将面临重大挑战?最近,GPT-6 Astra的发布引发了热议,社交平台上开始出现利用其控制机械臂和灵巧手进行操作的视频,这无疑对具身模型和世界模型的创业者提出了严峻问题。如果未来大模型能力显著提升,它是否会覆盖其他类型模型的功能?独立开发具身模型和世界模型是否还具有必要性?这个问题让众多从事具身智能和世界模型的创业者忧心忡忡。
在9月10日至12日举行的2026 Inclusion·外滩大会上,多位涉足相关领域的创业者分享了他们的看法。总体而言,大家认为,针对具身模型的优势目前依然存在,但时间可能仅有一到两年。四位创业者对于GPT-6的影响看法各异。
复杂的物理交互仍然是具身智能公司的最后防线。GPT-6 Astra的开放测试让人印象深刻。破壳机器人的创始人许华哲在会议上分享了测试结果,称GPT-6在语义与空间理解上表现优异,但在处理物理交互方面仍显不足。从前,视觉语言模型只能让机器人移动到目标旁边,却无能为力。而GPT-6则能在一些细小物品上,如筷子,完成拿起、旋转和递送的动作。“它能准确识别桌面上的物体,并朝着正确位置移动。”他说,然而在使用筷子拨动物体或堆叠物品等复杂物理任务上,GPT-6目前还是无能为力的。许华哲进一步指出,虽然通用模型能够解决一些基本问题,如“看见什么”、“物体位置”和“如何靠近并抓住”,但尚未完全理解物体受力和变化的机制,复杂的物理交互仍是具身智能领域的“堡垒”。
上海科技大学的研究员石野也在讨论中表示,GPT-6在三维视觉的表现给学术与工业界带来显著影响。一些以往需要长期研究积累与专业技能才能完成的三维任务,如今借助GPT-6和少量工具即可实现。他认为,尽管GPT和其他智能工具可以提升具身智能的效率与自动化程度,从操控机械臂完成简单任务,到真正像人一样理解物理世界,依然存在距离。
他进一步指出,GPT-6其实是功利的工具使用,而非真正理解与执行的能力,形容其如同一位优秀的“系统设计师”,能够合理拆解任务、构建系统和调用工具,但这并不意味着它具备稳定执行复杂物理任务的能力。自变量机器人公司的CEO王潜则指出,若未来OpenAI与Anthropic等公司涉足具身智能,也需处理物理数据采集、仿真建立和硬件问题等,最终结果可能依然是另一具身智能企业。
此外,即便通用模型日益强大,部署过程中仍面临一系列挑战。机器人需要实时反馈,计算能力、功耗、延迟和成本的匹配仍然至关重要。规模大的云模型很难以合理的速度和成本直接应用于机器人作业,因此行业需专注于训练更高效的专业模型以应对具身任务。
王潜表示,GPT-6的一个积极启示在于大规模预训练仍具有成效。Astra的表现说明,融合通用数据可以提升具身模型的能力,因此具身智能公司应持续推动数据采集、评估和训练的基础设施建设。
在“世界模型是AI走向物理世界的新大陆吗”这一主题的圆桌论坛中,创业者们认为通用大语言模型和具身模型并非相互对立。苏度科技的CEO韩铮提到未来机器人的上层能力与底层技能之间可能形成明确的分工,上层模型负责理解环境、进行抽象推理并拆解任务,而底层模型则专注具体的操作,如抓取、移动与连接。
韩铮强调,具身智能公司在与上层模型衔接时必须同时解决泛化性和成功率的问题,只有具备高泛化性和高成功率,才能确保上层模型的良好规划能够在实际执行中成功。他以团队的以往演示为例,上层模型通过语言理解环境并拆解指令,底层技能在物体和环境变化时需要保持可靠性,否则任务可能失败。
忆生科技的杨言超则聚焦于世界模型与GPT-6的协作,指出世界模型需具备预测、理解和记忆能力,并依据记忆不断学习新任务。他认为,如果世界模型能够调用GPT-6完成其擅长的任务,并在这一过程中强化记忆,便能形成具备预测、理解、记忆及持续学习能力的智能体。
许华哲设想未来或许能将具身模型与类似Codex或其他智能体的运行环境连接,把通用模型与机器人的专业能力相互结合。然而,创业者们面临的压力显然在加大。极佳视界的首席科学家朱政指出,GPT-6及语言模型公司的进展无疑给具身智能企业带来了挑战。