sakutto
生成AI· Gemini Robotics 2

Gemini Robotics 2とは?全身制御と複数台連携をわかりやすく解説

GeminiGoogle DeepMindロボティクスVLA
Gemini Robotics 2とは?全身制御と複数台連携をわかりやすく解説

Gemini Robotics 2とは

Gemini Robotics 2とは、Google DeepMind が2026年7月30日に発表した、ロボットを動かすためのAIモデル群です。同社は「次世代の適応的なロボットを動かす知能の層」と位置づけています。

ロボットの制御は長らく、決められた手順をあらかじめ書き込んでおくか、人が遠隔で操作するかのどちらかでした。同社はこの現状を出発点として、自分で学び、予測できない環境に適応する能力が欠けていること、そしてある機体で覚えた技能を別の機体へ移すことがきわめて難しいことを課題として挙げています。Gemini Robotics 2 はこの両方に手を入れたリリースです。

公式情報を見る →
Most robots are pre-programmed or teleoperated for narrow, repetitive task sequences. They lack the ability to truly learn for themselves or adapt to unpredictable environments. Moreover, transferring learned skills from one robot body to another remains incredibly difficult. / Today, we are introducing Gemini Robotics 2 - the intelligence layer powering the next generation of truly adaptable robots. — 従来のロボット制御が抱える課題と、Gemini Robotics 2 の位置づけに関する記述より

上半身から全身へ、制御の範囲が広がった

最大の変化は、動かせる体の範囲です。従来のモデルは、机の上で完結する作業をこなすために人型ロボットの上半身を制御するものでした。今回は歩く・かがむ・伸びるといった動きと物体の操作が、ひとつの流れとしてつながっています。

公式が挙げている例は、Apptronik(アプトロニック)の Apollo 2 という人型ロボットに「じょうろを下の棚の緑色のかごに入れて」と頼む、というものです。ロボットは指示を解釈し、テーブルまで歩いてじょうろを取り、数歩進んで棚まで移動し、目的の場所に置きます。歩く・掴む・置くが別々の機能としてではなく、ひとつの指示への応答として実行される点が新しいところです。

公式情報を見る →
While our previous models controlled the humanoid's upper-body to achieve table-top tasks, Gemini Robotics 2 expands physical AI into whole-body motions. / For example, when controlling Apptronik's Apollo 2 humanoid robot, we can ask it to "put the watering can into the green bin in the bottom shelf." Apollo processes the instruction, walks to the table, and picks up the watering can, takes a few steps to the shelves, and places it precisely in its destination. — 制御範囲の拡張および実演タスクの記述より

「VLA」は視覚と言語をモーターの動きに変える

Gemini Robotics 2 の中核は VLA と呼ばれる種類のモデルです。vision-language-action の頭文字で、日本語にすると視覚・言語・行動モデルとなります。

やっていることは名前のとおりで、カメラが捉えた映像と、人が与えた言葉の指示を受け取り、それをモーターをどう動かすかという信号へ変換します。文章を書く生成AIが「次に来る単語」を出力するのに対し、VLA は「次に取る動き」を出力する、と考えると近いでしょう。人型ロボットを足先から指先まで動かせるほか、腕が2本ある形式のロボットにも対応します。

公式情報を見る →
Gemini Robotics 2: Our most advanced vision-language-action model (VLA) that converts vision and language input into motor control, enabling a robot to take action. This model is capable of controlling full humanoids, from feet to fingertips, and other bi-arm robots. It also brings a new level of dexterous manipulation on both hands and grippers. — VLA モデルの定義と対応する機体の記述より

同じチェックポイントで別の機体を動かせる

技能の移し替えが難しいという冒頭の課題に対する答えが、ここに出ています。公式が公開した成績グラフは、ひとつの同じモデルチェックポイント(学習を終えたモデルの中身をそのまま保存したもの)で3種類の機体を制御した結果です。

内訳は、SharpaWave(シャーパウェーブ)ハンドを付けた Apollo 2、Inspire ハンドを付けた Apollo 2、そして Robotiq(ロボティック)グリッパを付けた Franka Duo(フランカ・デュオ)の3つです。グリッパとは物をはさんで掴む器具で、公式が使ったのは2本指で平行に開閉する標準的なものです。同じ人型ロボットでも手の構成が違い、3つ目にいたっては人型ですらありません。機体ごとに専用モデルを用意するのではなく、1つのモデルが複数の体に対応している、という主張です。

公式情報を見る →
Gemini Robotics 2 controlling three different embodiments, using the same model checkpoint — the Apptronik Apollo 2 robot with SharpaWave hands, the Apollo 2 robot with Inspire hands, and the Franka Duo with the Robotiq gripper — on a wide variety of whole-body and dexterous manipulation tasks. — 単一チェックポイントによる3機体制御の記述より

3つのモデルはどう役割を分けているか

Gemini Robotics 2 は単体のモデルではなく、役割の異なる3つのモデルで構成されています。ここを取り違えると「試せるかどうか」の判断を誤るので、先に整理しておきます。表中の VLA は前述の視覚・言語・行動モデル、VLM は映像と言語を扱う視覚言語モデルを指します。

Gemini Robotics 2 を構成する3つのモデル(公式発表による)

モデル種別担当する仕事
Gemini Robotics 2VLA視覚と言語をモーター制御へ変換し、実際に体を動かす
Gemini Robotics ER 2VLM人と対話し、物理世界を理解し、数分がかりの手順を計画する
Gemini Robotics On-Device 2VLAロボット本体の上で動く軽量版。新しい機体への適応を担う
公式情報を見る →
Gemini Robotics ER 2: Our most capable embodied reasoning (ER) model. It is a vision language model (VLM) that acts as our agent, enabling robots to communicate with humans, understand the physical world and plan multi-step tasks lasting several minutes. We are also introducing the ability for robots to work together as a team. / Gemini Robotics On-Device 2: Our most efficient vision-language-action model (VLA) optimized to run locally on robotic devices. This model can now achieve fast adaptation to completely new robot embodiments with a few hours of data. — ER 2 および On-Device 2 の種別と担当範囲に関する記述より

ER 2 は「考える側」を担当する

ER は embodied reasoning、つまり身体を持った状態での推論を指します。ER 2 は映像と言語を扱う VLM(vision language model)で、ロボットにとっての高次の頭脳として働きます。

部屋を観察し、作業に必要な手順を組み立て、VLA と連携して実行させ、終わるまで進捗を追います。この構成によって、途中の手順が失敗しても自分で立て直したり、初めて出会う状況や目標に対応したりできる、と説明されています。扱える長さは数分がかり、判断の数は数百に及ぶ規模です。作業の始まりと終わりを理解し、重要な出来事が起きた瞬間を特定できるようになった点も、今回の更新として挙げられています。

公式情報を見る →
It observes the room, reasons about the steps needed to complete the task, coordinates with the VLA to carry out the actions, and tracks progress until the task is done. This setup allows robots to execute complex multi-step tasks, self-correct if a step fails, and generalize to novel situations and goals. / In this update, we are enabling robots to more reliably execute longer task sequences, lasting several minutes and involving hundreds of decisions. Gemini Robotics ER 2 now understands when tasks begin and end, and can pinpoint the moment key events occur, marking a step change in progress understanding. — ER モデルの役割、扱えるタスク長、および作業の開始・終了の理解に関する記述より

種類の違うロボットどうしが連携できる

今回あわせて導入されたのが、複数ロボットの協調です。異なる種類のロボットが互いに意思疎通し、1台では成立しない作業を分担して進められるようになりました。

公式は、散らかった部屋を片付ける例で「他のロボットと組んで作業を早く終わらせることもできる」と述べています。人型ロボット1台の性能を上げる話ではなく、手が足りなければ台数を増やせる構成にする、という方向づけです。

公式情報を見る →
It can even team up with other robots to finish the job faster. / Furthermore, we are introducing multi-robot collaboration. This enables different types of robots to communicate and work together to solve complex workflows a single robot could not do alone. — 複数台で協力できる旨、および多ロボット協調の導入に関する記述より

On-Device 2 は「つながっていない現場」のためにある

3つ目の On-Device 2 は、ロボット本体の上で動かすことに最適化した軽量な VLA です。ネットワークの遅延やインターネット接続が期待できない環境を想定しています。

このモデルの役割で目立つのが、新しい機体への適応です。Gemini Robotics 1.5 から引き継いだ motion transfer(動きの移し替え)という手法により、腕が2本ある新しい機体には数時間・通常200例未満のデータで適応できるとしています。形状もセンサーも自由度(関節がいくつの向きに動けるかの数)もまったく異なる機体でも成立するとされ、Dexmate(デックスメイト)・SO101・Trossen(トロッセン)という3種類のプラットフォームでの実演が公開されています。

こうした仕様は原文で確認しておくと、限定条件の見落としを防げます。公式ブログをそのまま読み込める形に変換しておくと、あとから引用箇所を探しやすくなります。

無料ツールURLマークダウン変換URL(ウェブページ)を入力するだけでマークダウン(Markdown)に変換。見出し・表・リスト・リンクを保持したままmd化でき、LLMやRAGの前処理、調査資料の整形にも最適な無料オンラインツール。今すぐ使ってみる →

公式情報を見る →
This model is natively multi-embodiment and inherits our advanced "motion transfer" techniques from Gemini Robotics 1.5. We can now adapt to new bi-arm robot embodiments with just a few hours of adaptation time, typically with less than 200 examples. This works even with new embodiments with drastically different shapes, sensors and degrees of freedom, as shown below with a diverse set of tasks being performed by the Dexmate, SO101, and Trossen platforms. — オンデバイスモデルの適応速度と対象プラットフォームの記述より

公式が認めている限界

ここが、この発表でいちばん確認しておく価値のある部分です。同社は成果と並べて、まだできていないことを明示しています。

多指ハンドの細かい操作はまだ難しい

成績グラフの説明文には、全身動作とグリッパを使った作業では中〜高程度の成功率に達している一方、多指ハンドによる細かい操作は依然として難しいと書かれています。発表本文では、5本指で22の自由度を持つ SharpaWave ハンドで結び目を作ったりジップ袋を閉じたりできる、という到達点が語られていますが、それが安定して成功する水準にはまだ届いていない、というのが公式の自己評価です。

指を使う細かい作業ができるかどうかは、家庭や職場でロボットが実用になるかを分ける部分です。デモ映像で結び目が作れていることと、その作業を任せられることのあいだには、この成功率の差があります。

公式情報を見る →
While Gemini Robotics 2 achieves a medium to high success rate for whole-body and gripper-based dexterous tasks, the multi-finger dexterous manipulation remains challenging. / The model can now control the five-fingered, 22 degree-of-freedom SharpaWave hand on the Apollo 2 robot to complete delicate actions like tying knots or sealing a ziplock bag. — 多指操作の課題および SharpaWave ハンドの仕様に関する記述より

動作の速度にも改善の余地がある

じょうろを棚に入れる実演の記述の直後に、動きの速度にはまだ進歩が必要だという但し書きが置かれています。同社はこれを、全身の協調が必要な現実の作業へ向かうための重要な一歩だと位置づけたうえで、速度は課題として残ると述べています。

自律的に判断して動けることと、人と同じ速さで動けることは別の問題です。導入を検討する立場からは、作業が成立するかどうかだけでなく、それが実用的な時間で終わるかどうかも見る必要があります。

公式情報を見る →
While our robots have more to advance in movement speed, this is an important step towards the skills needed to complete more complex, real-world tasks that require whole-body coordination. — 動作速度に関する留保の記述より

安全性は「推論モデルが行動モデルを止める」構造で担保する

安全面では、ASIMOV-Agentic という新しいベンチマークが導入されました。測っているのは、推論を担う ER モデルが、行動を担う VLA からの危険なツール呼び出しを拒否できるかという点です。ツール呼び出しとは、AIが自分で外部の機能(ここではロボットの動作)を実行させる操作を指します。あわせて、その作業が実行可能かを予測できるか、確信が持てないときに人の介入を自分から求められるかも評価対象になっています。

考える側が動く側を監督する、という二層構造で安全を確保する設計です。ER 2 については、安全制約の遵守と人との距離に関するベンチマークで同社史上もっとも安全なロボティクスモデルだとしており、人が近づいたことを検知して安全に停止させる動作は、協調作業の安全規格が求める要件だと説明されています。

公式情報を見る →
We're introducing ASIMOV-Agentic, a new benchmark for agentic safety orchestration and uncertainty resolution. For example, it measures the embodied reasoning agent's ability to refuse unsafe tool calls from a VLA. It also measures the agent's ability to predict whether a task is possible and to proactively request human intervention when uncertain. / Additionally, with enhanced embodied reasoning, Gemini Robotics ER 2 is our safest robotics model to date in safety constraint following and human proximity benchmarks. It can better detect when humans are nearby, trigger safety tool calls and bring the robot to a safe stop if someone approaches too closely. This is a key requirement in collaborative safety standards. — ASIMOV-Agentic ベンチマークの測定対象、および人との近接に関する安全性能の記述より

いま試せる範囲はどこまでか

「発表された」ことと「使える」ことは別です。3つのモデルは提供状況が分かれています。

ER 2 だけが一般に触れる

推論を担う Gemini Robotics ER 2 は Google AI Studio で利用でき、Gemini Enterprise Agent Platform ではプライベートプレビューとして提供されています。Gemini のモデルを AI Studio で試したことがあれば、入口は同じです。

一方、実際にモーターを動かす VLA モデルとオンデバイスモデルは早期アクセスのパートナー限定です。手元にロボットがあっても、今すぐ Gemini Robotics 2 で動かせるわけではありません。試したい場合は Trusted Tester Program への登録が案内されています。

無料ツールURLマークダウン変換URL(ウェブページ)を入力するだけでマークダウン(Markdown)に変換。見出し・表・リスト・リンクを保持したままmd化でき、LLMやRAGの前処理、調査資料の整形にも最適な無料オンラインツール。今すぐ使ってみる →

公式情報を見る →
Gemini Robotics ER 2, our reasoning model, is now available on Google AI Studio and in private preview on Gemini Enterprise Agent Platform. Our VLA and On-Device models are available to early-access partners. — 3モデルの提供状況に関する記述より

汎用モデルがロボットを動かす流れの一部として見る

特定の作業に特化させず、汎用のAIモデルにロボットを操作させるという方向は、Google DeepMind だけの取り組みではありません。AnthropicProject Fetch で、ロボティクス用の訓練を受けていない汎用モデルに市販のロボット犬を操作させる実験を公開しています。

両者の力点は違います。Project Fetch が「特別な訓練なしでどこまでできるか」を測る実験なのに対し、Gemini Robotics 2 はロボット制御そのものを目的に作られたモデル群です。ただし Gemini という同じ基盤モデルの系譜から派生している点で、言語モデルの進歩がそのまま物理世界へ流れ込んでいる構図は共通しています。同社自身、今回を物理世界における AGI(汎用人工知能。人間と同じ幅広さで作業をこなせるAI)の実現へ向けた重要な節目だと表現しています。

公式情報を見る →
Gemini Robotics 2 marks an important milestone on the path toward solving AGI in the physical world. Unlocking the true potential of robotics requires moving past single-task automation toward general-purpose intelligence. — 汎用的な物理AIへの位置づけに関する記述より

まとめ:注目すべきは「同じモデルで別の体を動かせた」こと

Gemini Robotics 2 の発表で目を引くのは、人型ロボットが歩いて片付けをする映像のほうでしょう。ただし技術的にいちばん重い変化は、同じモデルチェックポイントのまま、手の構成が違う機体や人型ですらない機体を動かしたという一点にあります。

ロボットが普及しない理由のひとつは、機体ごとに作り直しが必要で、投じた開発が他へ移せないことでした。1つのモデルが複数の体に対応し、新しい機体にも数時間・200例未満で適応できるなら、その前提が変わります。

一方で、公式が自ら挙げた限界も同じくらい重要です。多指ハンドの細かい操作はまだ難しく、動作の速度にも改善の余地がある。そして実際に体を動かす VLA モデルは、まだ早期アクセスのパートナーしか使えません。今すぐ現場に入る技術ではなく、数年かけて効いてくる土台の話として読むのが妥当なところです。触れられるのは推論を担う ER 2 まで、というのが2026年8月時点の状況になります。

言語モデルとしての Gemini がどこまで来ているかはGemini 3.6 Flash の記事で扱っています。その進歩がロボットの体へ流れ込んでいるのが今回のリリースだ、と並べて読むと位置づけが掴みやすくなります。

無料ツールURLマークダウン変換URL(ウェブページ)を入力するだけでマークダウン(Markdown)に変換。見出し・表・リスト・リンクを保持したままmd化でき、LLMやRAGの前処理、調査資料の整形にも最適な無料オンラインツール。今すぐ使ってみる →

よくある質問

Q. Gemini Robotics 2とは何ですか?
Google DeepMindが2026年7月30日に発表した、ロボットを動かすためのAIモデル群です。中心となるGemini Robotics 2は、カメラで見た映像と言葉による指示をモーター制御へ変換するVLA(vision-language-action)モデルで、人型ロボットを足先から指先まで動かせると説明されています。
Google DeepMind Blog — Gemini Robotics 2
Our most advanced vision-language-action model (VLA) that converts vision and language input into motor control, enabling a robot to take action. This model is capable of controlling full humanoids, from feet to fingertips, and other bi-arm robots. Google DeepMind Blog — Gemini Robotics 2
Q. 従来のGemini Roboticsと何が違うのですか?
制御できる範囲が上半身から全身へ広がった点が最大の違いです。従来モデルは机の上で完結する作業のために人型ロボットの上半身を動かすものでしたが、Gemini Robotics 2は歩く・かがむ・伸びるといった全身の動きまで扱えるようになりました。
Google DeepMind Blog — Humanoids in motion
While our previous models controlled the humanoid's upper-body to achieve table-top tasks, Gemini Robotics 2 expands physical AI into whole-body motions. Google DeepMind Blog — Humanoids in motion
Q. 今すぐ試すことはできますか?
3つのモデルのうち、推論を担当するGemini Robotics ER 2はGoogle AI Studioで利用でき、Gemini Enterprise Agent Platformではプライベートプレビューとして提供されています。一方、実際にモーターを動かすVLAモデルとオンデバイスモデルは早期アクセスのパートナーに限定されており、誰でも使える状態ではありません。
Google DeepMind Blog — Gemini Robotics 2
Gemini Robotics ER 2, our reasoning model, is now available on Google AI Studio and in private preview on Gemini Enterprise Agent Platform. Our VLA and On-Device models are available to early-access partners. Google DeepMind Blog — Gemini Robotics 2
Q. 苦手なことは残っていますか?
残っています。公式が公開した成績グラフの説明文で、全身動作とグリッパを使った作業では中〜高程度の成功率に達している一方、多指ハンドによる細かい操作は依然として難しいと明記されています。動作速度についても、まだ改善の余地があると公式が認めています。
Google DeepMind Blog — 成績グラフ説明文
While Gemini Robotics 2 achieves a medium to high success rate for whole-body and gripper-based dexterous tasks, the multi-finger dexterous manipulation remains challenging. Google DeepMind Blog — 成績グラフ説明文

関連ツール

関連ツールカテゴリ

記事