これまでGoogleのTPUは世代ごとに1種類でした。第8世代で初めて、Googleは「学習」と「推論」という2つの仕事を別々のチップに割り当てました。「GoogleもAmazonも、AIチップを自分で作り始めた」で見た自社チップ内製の流れが、ここで一歩進んだ形です。
Googleは、AIを動かすための自社製チップ『TPU』の新型(第8世代)を発表しました。これまでは1種類でしたが、今回は『AIを賢く育てる作業(学習)』に強いTPU 8tと、『育ったAIを使って答えを出す作業(推論)』に強いTPU 8iの2つに分けました。仕事の中身が違うので、それぞれ専用にした方が速くて電気代も安くなるからです。NVIDIAのGPUを買い続けるより、自分で作った方が安く・省電力にできるという狙いがあります。
構造で言うと(投資家向け)も見る
Googleの第8世代TPU(8t/8i)は、学習と推論を別チップに分離した初の世代。8iは性能あたりコストを前世代比80%改善し推論経済性を前面に出す。NVIDIA依存を削る動きの象徴だが、Google CloudはGPUも併売しており棲み分けが基本。受益するのは設計のBroadcom・新規参入のMediaTek、製造のTSMC、メモリのSK hynix/Samsung。内製化はNVIDIAの取り分を一部削りつつ、AIチップ全体の裾野を広げる構図として複層で捉えるべき。
何が起きたのか
2026年4月22日、GoogleはCloud Next '26で第8世代TPUを発表しました。最大の変化は、TPUを「学習用」と「推論用」の2つに分けたことです。
学習用が「TPU 8t」、推論用が「TPU 8i」です。Googleが学習と推論で別々のチップを作ったのは、これが初めてです。前世代の第7世代TPU「Ironwood(アイアンウッド)」は推論を意識した1種類でしたが、第8世代では役割をはっきり分けました。
TPU 8tは大規模モデルのに特化します。1つの「スーパーポッド」に9,600チップをまとめ、121 ExaFLOPS(FP4、低精度演算の単位)の演算性能と2ペタバイトの共有メモリを持ちます。前世代Ironwood比で、1ポッドあたりの演算性能を約3倍、性能あたりコストを最大2.7倍に高めました。
TPU 8iはに特化します。1チップに288GBの(広帯域メモリ)3eと384MBのSRAM(チップ内の高速メモリ、前世代の3倍)を積み、前世代比で性能あたりコストを最大80%改善しました。Googleは「同じコストでほぼ2倍の処理量をさばける」としています。両チップとも、電力あたり性能はIronwood比で最大2倍に向上しています(Google)。
TPUとは何か
とは、GoogleがAI処理専用に設計したカスタムAIチップのことです。AIの計算で多用される行列演算(テンソル演算)に特化しており、用途を絞り込む代わりに、その処理を最も安く・省電力にこなせるよう作り込まれています。
TPUは特定用途向けに設計された半導体、いわゆるASIC(特定用途向け集積回路)の一種です。汎用のGPUが「何でもこなせる手数の多いチップ」なのに対し、TPUは「AIの計算だけを徹底的に速くしたチップ」です。Googleは2015年から社内でTPUを使い始め、現在はGoogle Cloud経由で外部企業も利用できます。
Googleは自社では工場を持たず、設計だけを行い、製造はTSMCなどの(半導体の受託製造専門会社)に委託します。この「設計する会社」と「作る会社」が分かれる分業構造は、「NVIDIAは工場を持っていない——「設計だけの会社」と「作るだけの会社」に分かれた半導体の分業構造」で詳しく扱っています。第8世代の設計はBroadcom(ブロードコム)とMediaTek(メディアテック)が支え、製造はTSMCが担うとされます(要確認)。NVIDIAと同じく「自分で設計したチップを、TSMCで作ってもらう」立場です。
なぜ学習と推論でチップを分けたのか
学習と推論は、求められる性能がまったく違うからです。
学習とは、大量のデータからAIモデルを作り込む処理です。膨大な計算を一気に回す力と、チップ同士をつなぐ高速な通信が要ります。だからTPU 8tは、9,600チップを1つにまとめて巨大な計算をこなす方向に振っています。
一方の推論は、完成したモデルを使って実際に答えを出す処理です。ユーザーが使うたびに発生し、回数が桁違いに多いため、1回あたりのコストと電力効率が勝負になります。
特に、AIエージェント(自律的にタスクをこなすAI)が普及すると、推論の回数はさらに増えます。1つの質問に何度も推論を重ねるためです。TPU 8iが288GBという大容量メモリと性能あたりコストの改善を前面に掲げたのは、この「推論が大量に発生する時代」を見据えたものです。GoogleはこれをCloud Next '26で「エージェント時代のためのチップ」と位置づけました(Google Cloud Blog)。
なぜハイパースケーラは自社チップを作るのか
GoogleだけでなくAmazon・Microsoft・Metaも自社AIチップを作っています。理由はコスト・電力・最適化・供給確保の4点です。
第1にコストです。NVIDIAの向けGPUは(製品を売った金額から製造原価を引いた利益の割合)が非常に高く、買う側はその利益分まで支払っています。だからこそ自社設計すれば、この上乗せを回避できます。しかも年間に大量のチップを回すハイパースケーラなら、巨額の設計費を十分に回収できます。
第2に電力です。AIデータセンターは電力が最大の制約になっており、専用設計すれば同じ処理を少ない電力でこなせます。
第3に最適化です。自社のモデルや処理パターンに合わせてチップを作れば、無駄な回路を削り、必要な部分だけを強化できます。
第4に供給確保です。GPUは慢性的に品薄で、NVIDIA一社への依存はリスクになります。だからこそ自社チップを持てば、調達を自分でコントロールできます。この4つの動機は「クラウド大手4社が独自AIチップを内製した理由、ASIC成長速度はGPUの2.8倍に」で見た構図と同じで、第8世代TPUはその最新の実例です。
ただし、これは「NVIDIAの本当の強さはGPUではなく、CUDAという「逃げられない仕組み」だった」で見たCUDAの囲い込みの裏返しでもあります。NVIDIAから完全に離れるのは難しく、だからこそ自社チップで「依存の度合い」を下げにいくのが現実的な戦略です。
今後どうなるか
第8世代TPUは「置き換え」ではなく「棲み分け」を前提にした一手です。
Googleは自社の生成AI「Gemini」の学習にTPUを使う一方、Google CloudではNVIDIA GPUも併売しています。多様なモデルを扱う研究開発にはCUDAエコシステムを持つGPUが強く、量が読める自社サービスの推論にはTPUがコスト・電力で有利だからです。つまり、両方を使い分けるのが基本シナリオです。
注目点は、TPU 8iの推論コスト改善が、外部企業の取り込みにつながるかどうかです。第8世代の両チップはGoogle Cloudで年内に一般提供される予定です(要確認)。推論コストが下がれば、AnthropicのようにGoogle Cloud上で大規模なAIを動かす企業が増える可能性があります。設計に新たにMediaTekが加わり、Broadcom1社体制が崩れた点も、カスタムAIチップ市場の競争が広がっている兆しです(CNBC)。
この記事のまとめ
- Googleは2026年4月のCloud Next '26で第8世代TPUを発表し、初めて学習用(TPU 8t)と推論用(TPU 8i)にチップを分けた。
- TPU 8tは1スーパーポッド9,600チップで121 ExaFLOPS(FP4)・2ペタバイトの共有HBMを持ち、前世代Ironwood比で性能あたりコストを最大2.7倍改善する。
- TPU 8iは1チップ288GBのHBM3eと384MBのSRAMを積み、性能あたりコストを最大80%改善、同コストでほぼ2倍の処理量をさばける。
- 学習と推論で要求が違うため専用設計に分けた。設計はBroadcomとMediaTek、製造はTSMCが担うとされる(要確認)。
- TPUはNVIDIA依存を削るハイパースケーラ共通の動きの一例で、GPUとは用途で棲み分けながらAIチップ市場の裾野を広げている。
この記事のまとめ
- Googleは2026年4月のCloud Next '26で第8世代TPUを発表し、初めて学習用(TPU 8t)と推論用(TPU 8i)にチップを分けた。
- TPU 8tは1スーパーポッド9,600チップで121 ExaFLOPS(FP4)、2ペタバイトの共有HBMを持ち、前世代Ironwood比で性能あたりコストを最大2.7倍改善する。
- TPU 8iは1チップ288GBのHBM3eと384MBのSRAMを積み、前世代比で性能あたりコストを最大80%改善、同コストでほぼ2倍の処理量をさばける。
- 学習と推論で要求が異なるため専用設計に分けた。設計はBroadcomとMediaTek、製造はTSMCが担う(要確認)。
- TPUはNVIDIA依存を削るハイパースケーラ共通の動きの一例で、GPUとは用途で棲み分けながらAIチップ市場の裾野を広げている。
よくある質問(FAQ)
Q.TPUとは何ですか?+
TPU(テンサー・プロセッシング・ユニット)とは、GoogleがAI処理専用に設計したカスタムAIチップのことです。AIの計算に多用される行列演算(テンソル演算)に特化しており、汎用GPUより用途は狭い代わりに、Googleのワークロードを安く省電力にこなせるよう最適化されています。2015年から社内で使われ、現在はGoogle Cloud経由で外部企業も利用できます。
Q.第8世代TPUの8tと8iは何が違うのですか?+
TPU 8tは大規模モデルの学習に特化したチップで、1つのスーパーポッドに9,600チップをまとめ、121 ExaFLOPS(FP4、低い精度で数える演算量の単位)の演算性能を出します。TPU 8iは推論に特化したチップで、1チップあたり288GBのHBM3e(広帯域メモリ)を積み、前世代比で性能あたりコストを最大80%改善します。第8世代は、Googleが初めて学習用と推論用でチップを分けた世代です。
Q.なぜGoogleは自社でTPUを作るのですか?+
理由はコスト・電力・最適化・供給確保の4点です。NVIDIA GPUは粗利率が高く、買う側は利益分まで支払います。自社設計すればこの上乗せを回避でき、自社の処理に合わせて電力効率を高められます。さらにNVIDIA一社への依存リスクも減らせます。年間に大量のチップを回すハイパースケーラなら、巨額の設計費を十分に回収できます。
Q.TPUはNVIDIA GPUを置き換えるのですか?+
完全な置き換えではなく棲み分けが進みます。多様なモデルを扱う研究開発にはCUDAエコシステムを持つGPUが強く、量が読める自社サービスの推論にはTPUのような専用チップがコスト・電力で有利です。Googleも自社のGemini学習にTPUを使いつつ、Google CloudではNVIDIA GPUも併売しており、両方を使い分けています。
用語集
- 推論(インファレンス)/ inference
- 学習済みのAIを実際に使って答えを出す処理。質問に答える・文章を生成するなど、利用時の計算がこれにあたる。
- 学習(トレーニング)/ training
- 大量のデータからAIモデルを作り込む処理。膨大な計算力を一度に必要とし、巨大なGPUクラスタを使う。
- HBM/ High Bandwidth Memory
- DRAMを積み重ねて広帯域にした高性能メモリ。AI半導体とセットで使われる。
- ASIC(カスタムチップ)/ Application-Specific Integrated Circuit
- 特定の用途だけに特化して作る専用チップ。汎用品より無駄がなく、決まった処理を安く・省電力でこなせる。
- ファウンドリ/ foundry
- 他社が設計した半導体を、受託して製造する工場。代表はTSMC。
- データセンター/ data center
- 大量のサーバーをまとめて置き、24時間動かし続ける施設。クラウドやAIの計算はここで行われる。
- 粗利率(売上総利益率)/ gross margin
- 売上から原価(作るのにかかった費用)を引いた儲けが、売上に対して何%あるかを示す割合。
参考資料・引用元
- Our eighth generation TPUs: two chips for the agentic era一次情報Google(blog.google)(2026-04-22)— 使用箇所: 第8世代TPUを学習用8tと推論用8iに分けた発表、8tの121 ExaFLOPS・9,600チップ・2PB、8iの288GB HBM・性能あたりコスト80%改善、電力性能2倍という一次情報(要確認)https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/eighth-generation-tpu-agentic-era/
- TPU 8t and TPU 8i technical deep dive一次情報Google Cloud Blog(2026-04-22)— 使用箇所: 学習用8tと推論用8iの技術仕様(前世代Ironwood比の性能あたりコスト、SRAM容量、エージェント時代という位置づけ)の裏取り(要確認)https://cloud.google.com/blog/products/compute/
- Google launches training and inference TPUs in latest shot at Nvidia報道CNBC(2026-04-22)— 使用箇所: NVIDIA依存を削る狙いという文脈、発表日(Cloud Next '26)、年内一般提供の見通しの確認(要確認)https://www.cnbc.com/2026/04/22/google-launches-training-and-inference-tpus-in-latest-shot-at-nvidia.html
- Google splits its TPU into two chips for the first time with training and inference variants報道Tom's Hardware(2026-04-22)— 使用箇所: 学習と推論で初めてチップを分けた点、クラスタ規模、NVIDIAとの比較の補強(要確認)https://www.tomshardware.com/tech-industry/semiconductors
- Google unveils eighth-generation TPUs, two dedicated training and inference chips報道DataCenterDynamics(2026-04-22)— 使用箇所: 設計をBroadcomとMediaTekが分担、製造はTSMC、HBM3e採用という設計・製造体制の裏取り(要確認)https://www.datacenterdynamics.com/en/news/google-unveils-eighth-generation-tpus-two-dedicated-training-and-inference-chips/
この記事をシェア
次に読む
コメント
GitHub アカウントでログインしてコメントできます。