Google DeepMindは、ロボットの“高次の頭脳”として動作する新モデル「Gemini Robotics ER 2」を発表しました。
映像を継続的に見ながら作業の進捗を把握し、複数ステップのタスクを計画・実行できるほか、複数のロボット同士が役割分担して連携することも可能になります。Google AI Studio・Gemini APIなどから利用できます。
AIニュース
公開日: ・出典: Google DeepMind公式ブログ
Google DeepMindは、ロボットの“高次の頭脳”として動作する新モデル「Gemini Robotics ER 2」を発表しました。
映像を継続的に見ながら作業の進捗を把握し、複数ステップのタスクを計画・実行できるほか、複数のロボット同士が役割分担して連携することも可能になります。Google AI Studio・Gemini APIなどから利用できます。
Gemini Robotics ER 2は、ロボットの「頭脳」として動作する推論モデルという位置づけです。同様の役割を担う競合の基盤モデルと比べると、それぞれの立ち位置の違いが見えてきます。
| 項目 | Gemini Robotics ER 2(Google) | GR00T N1(NVIDIA) | π0.5(Physical Intelligence) | Helix(Figure AI) |
|---|---|---|---|---|
| 位置づけ | ロボットの「頭脳」となる高次推論モデル(VLM) | ヒューマノイド向け基盤モデル(VLA、二層構成) | 汎用操作に特化したVLA(拡散/フローマッチング方式) | ヒューマノイド全身制御VLA(二層構成) |
| ベース | Gemini 3.5 Flash | 独自(一人称視点映像+Isaac Sim合成データで学習) | 独自(フローマッチング行動ヘッド) | 独自(低速の思考層+200Hz高速動作層) |
| 公開状況 | クローズド(API経由提供) | オープン(Isaac Labエコシステム向けに公開) | クローズド(一部パートナー限定) | クローズド(Figure社内利用のみ) |
| 特徴 | マルチステップ計画・進捗の自己追跡・複数ロボット間の連携、テキスト/画像/動画/音声を統合処理(128kコンテキスト) | 大量の一人称映像とシミュレーションデータで学習、エッジ端末向けに最適化 | 少数のデモで新しい環境・ロボットに素早く適応 | 低速な「思考」と高速な「反射」を分離した二層アーキテクチャの先駆け |
| 対応ロボット | Apptronik Apollo 2、Boston Dynamics Spot、Franka Duoなど複数機種 | Figure、Agility、Apptronik、1Xなど複数社が評価採用 | 主に提携先ロボットに限定 | Figure 02(自社ヒューマノイド専用) |
| 提供方法 | Google AI Studio / Gemini API | オープンモデルとして公開 | パートナー限定API | 非公開 |
※各社の技術ブログ・業界メディアの報道内容をもとに作成