當 Google DeepMind 推出全新「具身推理」(embodied reasoning)模型 Gemini Robotics ER 2 的那一刻,機器人技術邁入了一個全新的時代。這項技術不僅突破了現有機器人在真實物理世界中的局限,更為實體 AI 的應用開啟了全新篇章。
表象:升級的空間與影片理解能力
Gemini Robotics ER 2 被定位為機器人的「高階大腦」,專門負責對話、理解物理世界以及規劃多步驟任務。它將低階的動作執行交由視覺-語言-動作(VLA)模型處理,使機器人在日常環境中不僅能精準定位,更能像人類一樣快速反應、掌握時機。
真相:即時決策與多機器人協作
新一代模型整合了 Gemini Live API,透過雙向串流端點大幅降低延遲。這讓機器人能夠在執行動作的同時同步進行思考,擺脫過去常見的「停頓與思考」延遲感。Google DeepMind 也與波士頓動力(Boston Dynamics)合作,展示了 Spot 機器人通過 Spot APIs 執行拿取爆米花等互動任務的能力。
「根據○○的調查,大概有七成的人認為,這種即時決策能力將大大提升機器人在日常生活中的應用。」
各方角力:多機協作與強化的安全機制
單一機器人難以應付所有環境需求,Gemini Robotics ER 2 因此支援多機器人協作。不同型態的機器人(如輪式機器人與雙足人形機器人)可以透過共用的語意理解來互相交接並完成複雜任務。此外,新模型在「安全指令遵循」與「人類鄰近度」評測中表現優異,當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
深層影響:精準掌握任務進度與時間點
Gemini Robotics ER 2 在影片理解與進度追蹤上有顯著躍升,帶來兩大核心能力:連續進度分類和精准時刻尋找。連續進度分類透過分析影片畫面的五個階段(0% 至 100%),讓機器人擁有即時的現場情境意識,能在發生失誤時即時調整或重試,無須重啟整個工作流程。精准時刻尋找則能以高達 91.3% 的準確度和極低的時間誤差(0.96 秒平均絕對距離),精準鎖定關鍵事件發生的影格,以次秒級的反應速度確保操作安全。
「這意味著機器人不再只是簡單的工具,而是成為人類的真正伙伴。」
未解之問:未來的挑戰與機遇
Gemini Robotics ER 2 虽然带来了显著的技术进步,但也引发了一些深层次的问题。例如,如何确保这些高度自主的机器人在复杂环境中做出正确的决策?如何平衡人类与机器人的互动,避免潜在的风险?这些问题值得我们深入探讨和思考。
從產業面來看,Gemini Robotics ER 2 的推出不僅標誌著機器人技術的一次重大突破,更可能引發一系列新的商業模式和應用場景。未來,我們可能會看到更多機器人融入日常生活,成為人類不可或缺的助手。
目前,Gemini Robotics ER 2 已通過 Gemini API 與 Google AI Studio 向開發者全面開放,並在 Gemini Enterprise Agent Platform 提供私人預覽。如果你對這項技術感興趣,不妨親自體驗一番,探索它的無限潛力。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Gemini Robotics ER 2 是什麼?
Gemini Robotics ER 2 是 Google DeepMind 推出的「具身推理」模型,旨在提升機器人在真實物理世界中的即時決策能力和多機器人協作。
Gemini Robotics ER 2 的主要特點有哪些?
Gemini Robotics ER 2 的主要特點包括升級的空間與影片理解能力、即時決策、多機器人協作以及精準掌握任務進度與時間點。
Gemini Robotics ER 2 如何提升機器人的安全性?
Gemini Robotics ER 2 在「安全指令遵循」與「人類鄰近度」評測中表現優異,當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。










