机器之心发布 过去三年,大模型走完了一条已被反复验证的路:先在海量数据上预训练出能力,再用对齐把能力变成可用性,最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步,一步一个台阶。 于是一个问题开始在具身智能行业里产生: 这条路,能不能在物理世界原样再走一遍? 提出这个问题,是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前:模型在仿真榜单上分数越刷越高,演示视频越拍越炫,但真正放到真实环境里,换一个场景、换一台机器,往往就要重新采数据、重新训练。而在物理世界里,差一点就是失败,而失败之后,大多数机器人只能停在原地等人来解决。榜单上的领先,与真实世界的可用之间,始终隔着一段距离。 最近几天,一家名为 亮源新创 的具身智能公司,用两次技术发布给出了自己的回答:9 月 1 日,开源通用导航模型 LightNav-0 ;9 日又发布了机器人韧性控制技术 Light REACT 。 前者对应“ 对齐 ”,后者对应“ 部署 ”。两次发布落子的位置,严格对着大模型那三步棋。 这并不奇怪。这家公司的创始人 姜旭 ,此前是 OpenAI 的算法专家,方向是 RLHF,而这正是 ChatGPT 背后的对齐方法。他创业后率先提出 “规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)、规模化部署(Scalable Deployment)”的三段范式 。他的信条是: 通用比专用重要 ;即先实现全场景的泛化,再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比,这算得上是一条 “反共识”路线。 亲历者 参与过“能力如何变成可用性”的完整答案 要理解这家公司为什么这么下棋,得先回到 RLHF 在大模型历史上的位置。 2020 年的 GPT-3 已经证明了规模化预训练的威力,但它本质上只会“补全下一个词”。看起来能力惊人,却谈不上好用。真正的转折发生在 对齐 :InstructGPT 用人类反馈的强化学习,把“会补全”驯化成“会干活”,同一个基座模型,交互体验天差地别。再往后,ChatGPT 把对齐后的模型推到亿级用户面前,真实使用中暴露的问题源源不断回流,成为下一代模型的养料。也就是说, 能力、可用性、进化速度,分别来自三个不同的环节 ,这是大模型行业用五年时间换来的认知。 姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究,意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说,当很多团队还在讨论范式的理论框架时,他已经见过这套范式完整运转一遍的成果。 这段经历,解释了这家公司技术选择里那股罕见的笃定: LightNav-0 的后训练严格按“中期训练—SFT—在线 RL”三阶段展开,几乎是大模型后训练流程的具身翻版; Light REACT 则干脆把偏好对齐做进了机器人全身控制:先通过监督学习整合起身、行走和爬行技能,再用强化学习对齐“能站着走,就别爬”的人类偏好。 十天内两连发 对齐与部署,各落一子 9 月 1 日开源的 LightNav-0 ,解决的是“认路”。它以开源视觉语言模型为基座,不添加任何导航专用模块,同一套模型权重,可以 零样本地 部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调,就能听懂自然语言指令,自己找路。 据其技术报告, 该模型在 10 项公开仿真评测中取得领先 ;一个被复现者格外留意的细节是,仅用单目 RGB、不依赖深度与里程计,它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超,这类反直觉的数字,往往最能说明方法本身的含金量。 LightNav-0 在公开视觉语言导航评测基准上实现全面领先 设计上也有巧思:为了让模型“记住来路”又不被历史观测撑爆,团队按人类记忆的遗忘曲线来分配注意力,即越久远的画面,保留得越粗略,眼前的画面保留最高精度。数据则没有走遥操作采集的路,而是 把 2000 余个真实场景转化为仿真资产,在其中合成了 4000 余小时训练数据 。也就是说,真实世界负责定义数据分布的边界,仿真负责在这个边界内规模化合成,具身后训练由此跨过了最难的冷启动门槛。 视频链接:https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww 落到工程细节上,基座是 Qwen3-VL-4B-Instruct ,团队没有为导航添加任何专用头,而是选择了扩展词表。 双通道指点(dual-channel pointing)token 在图像坐标系中表达与任务、场景、本体无关的空间意图; 残差向量量化(RVQ)动作分词器 再把意图落成 10 步 SE(2)轨迹——一个粗码本加两级残差码本
发表评论