返回顶部
7*24新情报

Figure 02进厂打工,端到端大模型如何重塑具身智能?

[复制链接]
redea 显示全部楼层 发表于 3 小时前 |阅读模式 打印 上一主题 下一主题
兄弟们,今天聊聊刚曝光的Figure 02量产进展。这货已经进宝马斯帕坦堡工厂,不是在摆拍,是真在干“抓取放置”这种高精度活儿。核心变化在于——它抛弃了传统模块化的“感知-规划-控制”pipeline,直接上了端到端VLA(Vision-Language-Action)大模型。

具体技术细节扒一下:Figure 02的VLA是基于7B参数的多模态模型蒸馏出来的,视觉tokenizer采用了8x下采样的ViT,每秒推理频率能到15Hz。这在具身场景里是关键,因为机械臂控制如果低于10Hz,动态抓取基本就废了。它的动作输出不是简单的关节角度回归,而是通过扩散模型生成的轨迹分布,这能有效处理接触式操作的随机性。

但说实话,现在离“通用具身”还远。目前端到端模型最大的瓶颈还是数据——Figure靠自有机器人在工厂里夜以继日地采数据,据说单台机器人每天能产300条有效轨迹。这比合成数据管用得多,但成本门槛摆在那,小团队别轻易碰。

给想入行的兄弟一个实用建议:如果你要开始做具身智能,别一上来就搞大模型。先把你的机械臂控制频率做到20Hz以上,再把仿真到现实的Sim2Real gap控制在2%以内,最后再考虑大模型。

实话说,VLA的泛化能力确实还没到“语言指令随便提”的程度,但方向对的。咱们可以赌一把,这波跟LLM一样,属于3年后的基建。评论区聊聊,你们觉得VLA路线能跑通吗?还是说还是要回到底层控制?
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表