科技 · 2025年7月22日

字節跳動釋出通用機器人大腦 GR-3:少量資料高效微調,能理解抽象指令並精操作柔性物體

來源

一、突破性 VLA 架構:少量樣本,高效遷移

  • 顛覆傳統
    過往 VLA 模型依賴海量機器人軌跡與環境示例,GR-3 僅需 10–20 條人類示範資料,即可快速微調到新物體或新任務,成本和時間大幅降低。
  • 多源資料融合
    除高質量真機遙運算元據,Seed 團隊還經使用者授權,收集 VR 裝置下的人類軌跡,以及海量公開可用的視覺—語言資料,並通過聯合訓練提升泛化能力。

二、極致靈巧:從餐桌整理到掛衣收納

  1. 長序列任務穩健執行
    在含 ≥10 個子任務的“餐桌收拾”長流程測試中,GR-3 不僅完成率高達 92%,還能精準遵循每條分步指令。
  2. 柔性物體精準操作
    掛衣服實驗中,GR-3 能排程雙臂協同識別、抓取多種懸掛方式的衣物,動作流暢且容錯率 <5%。
  3. 抽象指令深度理解
    面對“將未見過的青瓷碗放入籃子”等抽象概念指令,GR-3 正確率超 85%,顯著領先現有 π0、CLIP-Grasp 等基準模型。

三、ByteMini:為“機器人大腦”量身定製的靈活軀體

  • 22 自由度全身關節
    雙臂、手腕球形關節與底盤移動一體化設計,讓 ByteMini 在狹窄空間亦能完成精細搬運、裝配、拆卸等 4–5 級巧操作。
  • 高可靠性與易部署
    模組化硬體與 ROS 原生相容,可快速裝載 GR-3 模型,完成 “從零到一” 的應用部署。

四、效能驗證與效果

  • 未見物體:加入公開圖文資料後,GR-3 抓放新物體成功率提升 33.4%;僅需 10 條 VR 軌跡即可將新物體操作成功率從 <60% 提升至 >80%。
  • 指令魯棒:面對無效或衝突指令(例如“將藍碗放入籃子”但場景中無藍碗),GR-3 能自動檢測並保持靜止,防止誤操作。
  • 超長流水線:在 15 步果蔬分揀、盤點任務中,GR-3 展現出高度穩健與一致性,單次失敗率低於 8%。

五、展望:邁向通用機器人“智慧大腦”

Seed 團隊認為,GR-3 的核心價值在於“少即是多”:以多模態多樣化資料預訓練、少量示例高效微調的方式,構建具備抽象理解與靈活操控能力的機器人平臺。未來,GR-3 將持續拓展至更多場景——從工業裝配、倉儲分揀到醫護輔助、家庭服務,為通用機器人“智慧大腦”奠定堅實基礎。