Google Gemini Robotics ER 2:機器人邁向「高階大腦」時代,精準度提升57.4%

一句話總結:Google 推出 Gemini Robotics ER 2,具備連續影片理解、任務進度追蹤、工具調度及多機器人協作能力,大幅提升機器人在真實世界的應用效能。

核心要點

  1. 加入連續影片理解: 能即時掌握任務完成進度,判斷執行過程是否出錯。
  2. 任務進度追蹤: 將影片中的每一個畫面依任務完成程度分為 5 個階段,準確率達 57.4%。
  3. 關鍵時刻辨識: 準確率達 91.3%,平均時間誤差僅 0.96 秒。
  4. 多機器人協作: 不同機器人可共享語意理解能力,共同完成複雜工作。
  5. 空間理解能力提升: 包括成功/失敗偵測、儀器讀值及視覺問答。

從產業面來看

Google Gemini Robotics ER 2 的推出,標誌著機器人在真實世界中的應用邁向新的里程碑。連續影片理解能力和多機器人協作功能,不僅提升了機器人的智能水平,更為工業自動化和家庭助手帶來了全新的可能性。未來,我們可以期待看到更多具備「高階大腦」的機器人,成為人類生活中的得力助手。

Google 在 30 日宣布推出 Gemini Robotics ER 2,這款最新模型被視為機器人的「高階大腦」。相較於前一代 Gemini Robotics ER 1.6,新版本加入了多項重要升級,使其在真實世界的應用中更加高效和智能。

其中,最引人注目的突破是連續影片理解(Continuous Video Understanding)能力。過去,機器人大多只能分析單張影像,而 Gemini Robotics ER 2 可以持續觀看攝影機畫面,即時掌握任務完成進度,判斷執行過程是否出錯,並決定是否需要重新嘗試或進入下一個步驟。

為了更精確地掌握工作進度,Gemini Robotics ER 2 新增進度分類功能,將影片中的每一個畫面依任務完成程度分為 0 至 20%、20 至 40%、40 至 60%、60 至 80% 及 80 至 100% 等階段。官方測試顯示,Gemini Robotics ER 2 在進度分類任務中的準確率約 57.4%,優於前一代模型。

另一項重要升級是關鍵時刻辨識(Moment Finding),可找出影片中任務完成的關鍵時間點,例如判斷咖啡何時倒至適當容量、燈泡何時完全鎖緊等。新模型在這項測試中的準確率達 91.3%,平均時間誤差僅 0.96 秒;相較同級大型模型,在維持高準確率的同時,推論速度約快 4 倍,且運算成本更低。

此外,Gemini Robotics ER 2 也正式加入多機器人協作功能。不同類型的機器人各有所長,例如輪式機器人擅長室內導航,人形機器人則更適合跨越崎嶇地形。Gemini Robotics ER 2 可讓不同機器人共享語意理解能力,彼此分工、交接任務,共同完成單一機器人無法獨立處理的複雜工作流程。

Google 展示了與波士頓動力(Boston Dynamics)的合作成果,透過 Gemini Robotics ER 2 整合 Spot 四足機器人的導航 API 與機械手臂控制能力,使用者只需以自然語言下達「幫我拿爆米花」等指令,Spot 便能自主導航、尋找目標物並完成取物。Google 也同步於 GitHub 公開相關範例程式,供開發者參考與應用。

Gemini Robotics ER 2 也全面提升空間理解能力,包括成功/失敗偵測、儀器讀值及視覺問答。在成功/失敗偵測方面,Gemini Robotics ER 2 現在可直接分析原始影片串流,而非僅依賴靜態影像,因此能在任務執行過程中即時偵測液體灑出、物品滑落、對位偏移等失敗情況。

在儀器讀值方面,Gemini Robotics ER 2 已從過去主要支援類比儀表,擴展至可辨識 10 種不同類型的儀器,包括數位顯示器、直尺、線性刻度及液體溫度計等,可因應更多工業場域的檢測需求。

在視覺問答方面,受惠於 Gemini 多模態理解能力的提升,機器人能更準確理解複雜的視覺資訊,並回答與空間環境相關的問題。

在安全性方面,Gemini Robotics ER 2 在人員接近偵測及安全指令遵循兩項測試中,表現均優於前一代模型。舉例來說,當有人靠近機器人時,系統能自動停止作業、持續監測周遭環境,並在確認人員離開後自主恢復工作。

Google 同時推出全新的安全評估基準,檢驗 AI 是否具備執行安全限制、持續監控環境、判斷動作是否符合物理可行性,以及在必要時主動向人類尋求確認等能力,進一步提升未來具身 AI(Embodied AI)的安全性。

Gemini Robotics ER 2 已通過 Gemini API(可於 Google AI Studio 使用)開放開發者;企業版則以 Private Preview 形式於 Gemini Enterprise Agent Platform 提供。

一句話結論

Gemini Robotics ER 2 的推出,不僅提升了機器人在真實世界的應用效能,更為未來的工業自動化和家庭助手帶來了無限可能。

對於開發者和企業來說,這是一個不容錯過的機會,建議立即探索 Gemini API,體驗新一代機器人「高階大腦」的強大功能。

本文改寫整理自公開新聞來源,原始報導由自由時報發布。

常見問題 FAQ

Gemini Robotics ER 2 的主要突破有哪些?

Gemini Robotics ER 2 主要突破包括連續影片理解、任務進度追蹤、工具調度及多機器人協作能力。

Gemini Robotics ER 2 的進度分類功能如何工作?

Gemini Robotics ER 2 將影片中的每一個畫面依任務完成程度分為 5 個階段,準確率約 57.4%。

Gemini Robotics ER 2 如何提高安全性?

Gemini Robotics ER 2 在人員接近偵測及安全指令遵循兩項測試中,表現均優於前一代模型,能自動停止作業並在確認人員離開後恢復工作。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。