「フィジカルAI」という言葉を、2025年ごろから聞くようになった人は多いはずだ。提唱しているのはNVIDIAだ。同社のジェンスン・フアンCEOは2025年1月のCES基調講演で、AIの進化をこう説明した。
知覚AI(画像や言葉を理解する段階)から生成AI(文章や画像を作る段階)へ、そしてフィジカルAIへと進んできた、という説明だ。この記事では、その言葉の中身と、実際にロボットを動かしている半導体の正体を、一次情報にもとづいて整理する。
フィジカルAIは、ロボットの『頭脳』に使われる新しいAIの呼び方です。これを動かす半導体は3つの役割に分かれます。データセンターでAIを鍛える大きなGPU、ロボットの頭に載る小さな推論チップ、そして手足を動かすパワー半導体です。提唱しているのはNVIDIAで、まだ広く定まった学術用語ではありません。
構造で言うと(投資家向け)も見る
NVIDIAが提唱する『フィジカルAI』は次世代成長市場を語るマーケティング用語だが、半導体需要の3層構造(学習GPU・エッジ推論SoC・パワー半導体)は実在の製品ラインで裏づけられる。Jetson Thor T5000は条件付きで最大2070TFLOPS(FP4・スパース・MAXNモード時)・128GB・40〜130W。ゴールドマン・サックスは2024年1月時点でヒューマノイドのTAMを2035年380億ドルと予測(2年前の60億ドル予測から上方修正)。ただし数値は前提と時点に強く依存し、単純な横比較は禁物。
フィジカルAIとは何か
フィジカルAIとは、NVIDIAのフアンCEOが2025年1月のCES基調講演で説明した言葉で、「知覚し、考え、計画し、行動できるAI」を指す。これまでのAI(画像や言葉を理解する「知覚AI」、文章や画像を作る「生成AI」)の延長線上にある次の段階として位置づけられている。
ただし、この3段階モデルはNVIDIA自身の説明でも一貫していない。CES基調講演と同じ日に出た同社の別の発表資料は、生成AIの次の段階を「フィジカルAI」ではなく「エージェントAI」(自律的に判断し行動するAIという意味)と呼んでいる。公式の用語集ページにいたっては段階モデル自体を示さず、「生成AIに、空間関係や3次元世界での物理的なふるまいの理解を拡張したもの」とだけ定義している。
つまりフィジカルAIは、学術的に確立した固定の分類ではなく、NVIDIAが自社製品を語るための枠組みだと理解しておくのが正確だ。半導体全体の中でAIがどう位置づけられるかは「AI半導体とは何か」で先に確認しておくと理解が早い。
フィジカルAIを支える半導体は、なぜ3層に分かれるのか
ロボットが「見て・考えて・動く」までには、性質のまったく違う3種類の計算が必要になる。NVIDIAはこれを、学習・推論・駆動という3つの層に分けて製品を展開している。
第1層:データセンターでの学習とシミュレーション
まず、ロボットの「頭脳」となるAIモデルは、の大型GPUでされる。学習の段階では、実際にロボットを何百万回も壊しながら試行錯誤させるわけにはいかない。そこでNVIDIAは、Omniverse・Cosmos・Isaac Simといった仮想空間ソフトを使い、コンピュータの中でロボットに練習させる方法を採っている。
NVIDIA Researchのミンユー・リュウ副社長は2025年8月の同社ブログでこう述べている。「フィジカルAIには、現実のように感じられる仮想環境が必要だ——ロボットが安全に試行錯誤できる、もう一つの世界のような環境である」。この発言はシミュレーション製品を売る立場からのものであり、仮想空間での練習だけで実機がそのまま動くと決まったわけではない点には注意したい。
第2層:ロボットに載るエッジ推論SoC
学習を終えたAIモデルは、ロボット本体に載る半導体(SoC=複数の処理機能を1個のチップにまとめた半導体)の上で動く。ここでの計算を「推論」と呼び、学習で作った知識を使って「今、何をすべきか」を判断する処理を指す。代表例がNVIDIA Jetson Thorだ。
NVIDIAは2026年3月の発表で、Jetson Thorを「シミュレーションでの学習から実世界での運用へ、より速く・賢く・確実に移行させる」プラットフォームと位置づけている。同社はこれを「ヒューマノイド向けスーパーコンピュータ」とも呼んでいる。
上位モデルのT5000は、公式スペックによると128GBのメモリを積み、消費電力は40〜130Wの範囲で調整できる。計算性能は条件によって大きく変わる。精度を落として数をこなす「FP4」という計算方式と、計算を間引く「スパース」処理を組み合わせる。さらに消費電力を使い切る「MAXN」モードにすると、最大で1秒間に2070兆回の計算(2070TFLOPS)をこなせる。
ただし同じ条件でも計算の精度を上げると1035兆回程度に半減し、標準の電力設定(120W)では1820兆回程度になる。数字だけを覚えるより、「条件次第で大きく上下する」という点のほうが重要だ。なお、Jetson Thorが担うのは周囲の理解や動作計画といった処理であり、モーターそのものをリアルタイムに制御する役割は別のチップが担う。CPUとGPUがどう役割分担しているかの基本は「CPUとGPUの違い」で解説している。
第3層:関節を動かすパワー半導体
推論チップが「次にどう動くか」を決めても、実際に関節やモーターを動かすには、大きな電流を精密に制御するパワー半導体が要る。ここで存在感を増しているのがGaN(ガリウムと窒素の化合物半導体で、シリコンより高い電圧・電流を小さな部品で扱える)だ。テキサス・インスツルメンツ(TI)はヒューマノイド関節の駆動向けに、GaNを使ったモータードライバを展開している。
同社は「GaN技術は、ドライバ回路を一体化することでパワー段の大きさを半分以下にする」と説明している。関節1つひとつに小型・高効率なモーター制御が必要になるヒューマノイドにとって、パワー半導体の小型化は設計の自由度に直結する。
GR00Tは、ロボットの頭の中で何をしているのか
推論チップの上で実際に動くAIモデルの代表が、NVIDIA Isaac GR00Tだ。2025年3月に発表された初代GR00T N1の論文によると、このモデルは2つのAIを組み合わせた「二重システム」構造を持つ。周囲の状況と指示をじっくり解釈するのが「System 2」(画像と言葉を理解するAI)である。
その判断をもとに、滑らかな動作へすばやく変換するのが「System 1」(拡散トランスフォーマーという、連続的な動きの生成が得意なAI技術)だ。この2つは一体で学習されている。NVIDIAは人間の反射的な判断とじっくり考える判断になぞらえて説明しており、人間の認知の仕組みに着想を得た設計だとしている。
フィジカルAI・ヒューマノイド市場はどれくらいの規模になるのか
半導体需要を左右するのが市場規模の見通しだ。ゴールドマン・サックスは2024年1月時点のレポートで、ヒューマノイドロボットの獲得可能市場(TAM=実現しうる最大の市場規模)が、2035年に380億ドル、累計出荷1400万台に達すると予測した。これは同社が約2年前に示した60億ドル予測から6倍超に引き上げられた数字だ。
ただしこの予測は2024年1月という時点のものであり、2026年8月の今では2年半以上前のデータになる。他の調査会社の予測にも幅があり、単一の数字を確定値として扱うのは避けたい。
日本国内でも半導体・AI産業全体を成長分野と位置づける動きがあるが、フィジカルAI固有の政府目標は今回の取材では一次情報を確認できなかった。半導体産業全体の国内目標については「日本成長戦略が掲げる数値目標」を参照してほしい。なお、ロボットに載るカメラ・センサーの半導体や、Tesla・Figure・Unitreeなど個別メーカーの量産計画についても、今回の取材で一次情報による裏づけが取れなかったため、本記事では扱っていない。
この記事のまとめ
- フィジカルAIとは、NVIDIAのフアンCEOが提唱する言葉で、物理世界を知覚し考え行動できるAIを指す。NVIDIA自身の説明も一貫しておらず、確立した学術用語として扱うべきではない。
- 支える半導体は3層構造。①データセンターで学習・シミュレーションする大型GPU、②ロボットに載るエッジ推論SoC(Jetson Thorなど)、③関節を動かすGaNパワー半導体で構成される。
- Jetson Thor T5000は条件付きで最大2070兆回/秒の計算をこなせるが、精度や電力モードで数値は大きく変わる。NVIDIAは「ヒューマノイド向けスーパーコンピュータ」と位置づけるが、リアルタイムのモーター制御チップではない。
- Isaac GR00Tは、状況を解釈する『System 2』と滑らかな動作に変換する『System 1』の二重構造を持つAIモデル。実ロボットデータ・人間動画・合成データを混ぜて学習している。
- ゴールドマン・サックスは2024年1月時点でヒューマノイド市場を2035年380億ドルと予測。センサーや個別メーカーの量産計画など一次情報で確認できなかった領域は本記事では扱っていない。
よくある質問(FAQ)
Q.フィジカルAIとは何ですか?+
フィジカルAIとは、NVIDIAのジェンスン・フアンCEOが提唱する言葉で、カメラやセンサーで物理世界を知覚し、考え、計画し、実際に行動できるAIを指します(2025年1月、CES基調講演)。学術的に確立した定義ではなく、NVIDIA自身の説明も一貫していません。同社の別の発表資料では、生成AIの次の段階を「エージェントAI」と呼ぶこともあり、記事や図表を見るときは「NVIDIAがそう呼んでいる」という前提を忘れないことが大切です。
Q.フィジカルAIを支える半導体はどう分かれていますか?+
大きく3つの層に分かれます。①データセンターでAIを学習・シミュレーションさせる大型GPU、②ロボット本体に載せて周囲を認識し次の動きを判断するエッジ推論SoC(NVIDIA Jetson Thorなど)、③実際に関節やモーターを動かすGaN(窒化ガリウム)パワー半導体です。1つのロボットを動かすには、この3層すべてが必要になります。
Q.Jetson Thorとは何ですか?+
NVIDIAがロボット向けに設計したエッジ推論用の半導体(SoC)です。上位モデルのT5000は、精度を落として数をこなすFP4という計算方式・間引き演算・消費電力を使い切るMAXNモードという条件がそろったとき、最大で1秒間に2070兆回の計算をこなせます(公式データシート)。ただし同じ条件でも標準の電力設定では1820兆回、計算の精度を上げると1035兆回程度に下がるため、単純な最大値だけを覚えるのは誤解のもとです。NVIDIAはこれを「ヒューマノイド向けのスーパーコンピュータ」と位置づけていますが、モーターを直接リアルタイム制御する用途ではありません。
Q.Isaac GR00Tとは何ですか?+
NVIDIAが公開しているヒューマノイド向けの基盤AIモデルです。周囲の状況と指示をゆっくり解釈する「System 2」(視覚言語モデル)と、それをもとに滑らかな動作へ素早く変換する「System 1」(拡散トランスフォーマーというAI技術)の二重構造を持ちます。実ロボットの動作データ・人間の動画・シミュレーションで作った合成データを組み合わせて学習しており、2025年3月公開の初代N1から改良が続いています。
Q.フィジカルAI・ヒューマノイド市場の規模はどれくらいですか?+
ゴールドマン・サックスは2024年1月時点の予測として、ヒューマノイドロボットの獲得可能市場(TAM)が2035年に380億ドル、累計出荷1400万台に達するとしています。これは同社が約2年前に出した60億ドル予測からの大幅な上方修正です。ただし2024年1月時点の予測であり、他の調査会社の予測とは幅があるため、単一の数字を確定値として扱うべきではありません。
用語集
- 推論(インファレンス)/ inference
- 学習済みのAIを実際に使って答えを出す処理。質問に答える・文章を生成するなど、利用時の計算がこれにあたる。
- 学習(トレーニング)/ training
- 大量のデータからAIモデルを作り込む処理。膨大な計算力を一度に必要とし、巨大なGPUクラスタを使う。
参考資料・引用元
- CES 2025: Jensen Huang's Special Address一次情報NVIDIA(公式ブログ)(2025-01-06)— 使用箇所: フアンCEOの逐語発言「It started with perception AI...Then generative AI...Now, we're entering the era of physical AI」。知覚AI→生成AI→フィジカルAIという進化の語り口の一次出典。同日の別発表資料は第3段階を『エージェントAI』と呼んでおり、表現が一貫していない点の裏づけにも使用https://blogs.nvidia.com/blog/ces-2025-jensen-huang/
- What Is Generative Physical AI?一次情報NVIDIA(公式用語集)(2025)— 使用箇所: NVIDIA公式用語集の定義『Physical AI extends current generative AI with an understanding of spatial relationships and the physical behavior of the 3D world』。段階モデルを示さない中立的な定義文として使用し、CES基調講演の物語調とのズレを示すhttps://www.nvidia.com/en-us/glossary/generative-physical-ai/
- NVIDIA Research Unveils Physical AI Advances at SIGGRAPH 2025一次情報NVIDIA(公式ブログ)(2025-08-11)— 使用箇所: NVIDIA Research副社長Ming-Yu Liu氏の発言『Physical AI needs a virtual environment that feels real, a parallel universe where the robots can safely learn through trial and error』。シミュレーション(Omniverse/Cosmos/Isaac Sim)の必要性を語る一次発言として、製品を売る立場からの主張である旨とあわせて使用https://blogs.nvidia.com/blog/physical-ai-research-siggraph-2025/
- NVIDIA and Global Robotics Leaders Take Physical AI to the Real World一次情報NVIDIA(公式プレスリリース)(2026-03-16)— 使用箇所: 『These systems are powered by the NVIDIA Jetson Thor robotic computing platform, enabling developers to move from simulation training to real-world deployment with greater speed, intelligence and reliability』。学習→シミュレーション→実機推論という3段構えの位置づけの一次出典https://nvidianews.nvidia.com/news/nvidia-and-global-robotics-leaders-take-physical-ai-to-the-real-world
- Jetson Thor — Supercomputer for Humanoids一次情報NVIDIA(公式製品ページ)(2026)— 使用箇所: T5000のスペック表(2070 TFLOPS FP4-Sparse・128GB 256-bit LPDDR5X・273GB/s・14コアArm Neoverse-V3AE・電力40W-130W)、『Supercomputer for Humanoids』の見出し、Isaac GR00Tワークフロー対応の記載https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor/
- Jetson Thor Series Modules Datasheet (DS-11945-001 v1.5)一次情報NVIDIA(公式データシート)(2026-06)— 使用箇所: T5000のFP4性能内訳(Sparse/MAXN=2070TFLOPS、Dense/MAXN=1035TFLOPS、120Wモード=1820TFLOPS)と電力モード区分(70W/90W/120W/MAXN、TMP最大130W)の一次データ。T4000は70W/MAXNの2区分のみである点の裏づけにも使用https://developer.nvidia.com/downloads/assets/embedded/secure/jetson/thor/docs/jetson-thor-series-modules-datasheet_ds-11945-001.pdf
- GR00T N1: An Open Foundation Model for Humanoid Robots調査会社arXiv(NVIDIA, Bjorck et al.)(2025-03-18)— 使用箇所: GR00T N1の二重システム構成(System2=視覚言語モジュール/System1=拡散トランスフォーマー)と『Both modules are tightly coupled and jointly trained end-to-end』の一次記述。学習データが実ロボット軌跡・人間動画・合成データの異種混合であること、シミュレーション78万デモ(約6,500時間)などのデータピラミッド数値の出典https://arxiv.org/abs/2503.14734
- NVIDIA Isaac GR00T N1 Open Humanoid Robot Foundation Model一次情報NVIDIA(公式プレスリリース)(2025-03)— 使用箇所: 『System 1, a fast-thinking action model, mirroring human reflexes or intuition, and System 2, a slow-thinking model for deliberate, methodical decision-making』『inspired by principles of human cognition』の一次記述。人間の認知になぞらえた表現の帰属先として使用(『模した』ではなく『着想を得た』という弱い訳を採用)https://nvidianews.nvidia.com/news/nvidia-isaac-gr00t-n1-open-humanoid-robot-foundation-model-simulation-frameworks
- Humanoid Robots一次情報ルネサス エレクトロニクス(公式)(2026)— 使用箇所: 『Renesas delivers system-level solutions for humanoid designs, combining high-performance processing, advanced motor control, robust power devices, and AI enablement』。RZ/V2Hを中核とするシステムレベルソリューションの一次出典。ヒューマノイド向けは2026年8月時点で『今後の事業機会』の位置づけで採用実績は非公開という限定つきで使用https://www.renesas.com/en/applications/industrial/robotics/humanoid-robots
- Humanoid robot一次情報Texas Instruments(公式)(2026)— 使用箇所: 『GaN technology reduces the size of the power stage by more than 50% compared to MOSFET alternatives, thanks to integrated drivers』。GaNモータードライバ(DRV7308・DRV7167)の関節駆動向け提供という一次情報。TIが提供している事実であり特定ロボットへの採用実績ではない点に注意して使用https://www.ti.com/applications/industrial/robotics/humanoid-robot/overview.html
- The Global Market for Robots Could Reach $38 Billion by 2035一次情報Goldman Sachs(公式)(2024-01(Web公開2024-02-27))— 使用箇所: 『The total addressable market for humanoid robots is projected to reach $38 billion by 2035, up more than sixfold from a previous projection of $6 billion』。2024年1月時点のTAM予測(累計140万台)と、約2年前の60億ドル予測からの上方修正という文脈。2026年8月時点で約2.6年前のデータである時点明記とあわせて使用https://www.goldmansachs.com/insights/articles/the-global-market-for-robots-could-reach-38-billion-by-2035
この記事をシェア
次に読む
コメント
GitHub アカウントでログインしてコメントできます。