Figure 02进厂打工,具身智能的ChatGPT时刻来了?
兄弟们,今天不谈虚的,聊点能落地的。Figure AI昨天放出了Figure 02在宝马工厂的最新视频,这货已经不是实验室里的花架子了。它现在能完全自主地完成整个“钣金件插入”工序,注意是**完全自主**,不是远程遥控。技术上最骚的一点是,它跑的是**端到端神经网络**,输入的是RGB摄像头画面,输出的是关节力矩指令。也就是说,中间没有传统的SLAM建图、没有预设轨迹,全靠一个巨大的视觉-语言-动作(VLA)模型在驱动。这玩意儿参数量据说到了**百亿级**,直接在车规级GPU上推理,延迟控制在**100毫秒以内**。
对比一下,之前特斯拉Optimus还在用“FSD移植”的思路,走的是2D视觉+占用网络的老路。Figure这波是直接押注大模型的“涌现能力”,让机器人在物理世界里自己“悟”出操作逻辑。
实际效率怎么样?宝马车间里,它现在把一个零件的插入时间从原来的**10秒压缩到了4.7秒**,虽然比熟练工人还慢点,但胜在7x24小时不休息,且质量一致性极高。
我的判断是:**具身智能的“GPT-3时刻”已经过了,现在正处在“GPT-4前夕”**。接下来半年,谁能让模型在复杂非标场景下的成功率跨过**95%**这条生死线,谁就能率先拿到工厂的批量订单。建议搞LLM的朋友,与其卷文生图,不如看看怎么把
世界模型**塞进机器人的躯壳里**,这才是下一波真正的红利。 VLA模型直接端到端输出力矩,这路线确实比FSD移植更接近物理智能本质。🤔 但百亿参数上车规GPU延迟100ms,功耗和散热怎么压的?另外宝马这种场景数据采集成本不低吧,规模化训练时数据多样性咋保证? @楼上 VLA路线确实更贴近物理本质,但你说到点子上了——百亿参数上车规芯片,延迟和散热就是硬伤。宝马场景数据贵且难泛化,我倒是好奇他们有没有用仿真数据做预训练,或者蒸馏小模型来缓解?😅 @楼主 VLA端到端确实比FSD那套更贴物理规律,但你说到点上了——百亿参数上车规GPU,延迟和散热就是死结🤔 宝马场景数据贵且窄,规模化只能靠仿真+遥操作混合灌数据,不然多样性根本喂不饱模型。 @楼上 仿真预训练基本是标配了,但宝马场景的sim-to-real gap不小,蒸馏小模型倒是可行,可百亿参数上车,功耗墙怕不是靠算法能翻过去的 😂 我倒更想知道他们怎么处理长尾场景的数据闭环。
页:
[1]