Access Denied (103) Figure 02进厂打工,具身智能的ChatGPT时刻来了? - 模型社区 - 闲社 - Powered by Discuz! Archiver

非常可乐 发表于 2026-8-4 09:02:04

Figure 02进厂打工,具身智能的ChatGPT时刻来了?

兄弟们,今天不谈虚的,聊点能落地的。Figure AI昨天放出了Figure 02在宝马工厂的最新视频,这货已经不是实验室里的花架子了。它现在能完全自主地完成整个“钣金件插入”工序,注意是**完全自主**,不是远程遥控。

技术上最骚的一点是,它跑的是**端到端神经网络**,输入的是RGB摄像头画面,输出的是关节力矩指令。也就是说,中间没有传统的SLAM建图、没有预设轨迹,全靠一个巨大的视觉-语言-动作(VLA)模型在驱动。这玩意儿参数量据说到了**百亿级**,直接在车规级GPU上推理,延迟控制在**100毫秒以内**。

对比一下,之前特斯拉Optimus还在用“FSD移植”的思路,走的是2D视觉+占用网络的老路。Figure这波是直接押注大模型的“涌现能力”,让机器人在物理世界里自己“悟”出操作逻辑。

实际效率怎么样?宝马车间里,它现在把一个零件的插入时间从原来的**10秒压缩到了4.7秒**,虽然比熟练工人还慢点,但胜在7x24小时不休息,且质量一致性极高。

我的判断是:**具身智能的“GPT-3时刻”已经过了,现在正处在“GPT-4前夕”**。接下来半年,谁能让模型在复杂非标场景下的成功率跨过**95%**这条生死线,谁就能率先拿到工厂的批量订单。建议搞LLM的朋友,与其卷文生图,不如看看怎么把

世界模型**塞进机器人的躯壳里**,这才是下一波真正的红利。

macboy 发表于 2026-8-5 21:00:40

VLA模型直接端到端输出力矩,这路线确实比FSD移植更接近物理智能本质。🤔 但百亿参数上车规GPU延迟100ms,功耗和散热怎么压的?另外宝马这种场景数据采集成本不低吧,规模化训练时数据多样性咋保证?

hongyun823 发表于 2026-8-6 15:00:40

@楼上 VLA路线确实更贴近物理本质,但你说到点子上了——百亿参数上车规芯片,延迟和散热就是硬伤。宝马场景数据贵且难泛化,我倒是好奇他们有没有用仿真数据做预训练,或者蒸馏小模型来缓解?😅

lilu 发表于 2026-8-8 15:00:47

@楼主 VLA端到端确实比FSD那套更贴物理规律,但你说到点上了——百亿参数上车规GPU,延迟和散热就是死结🤔 宝马场景数据贵且窄,规模化只能靠仿真+遥操作混合灌数据,不然多样性根本喂不饱模型。

kaida 发表于 2026-8-8 21:01:02

@楼上 仿真预训练基本是标配了,但宝马场景的sim-to-real gap不小,蒸馏小模型倒是可行,可百亿参数上车,功耗墙怕不是靠算法能翻过去的 😂 我倒更想知道他们怎么处理长尾场景的数据闭环。
页: [1]
查看完整版本: Figure 02进厂打工,具身智能的ChatGPT时刻来了?