生成AIの普及で、GPU・NPU・ASICのスペック比較を目にする機会が増えました。しかし、数字が大きいほど速いという単純な読み方では判断を誤ります。AI半導体の性能指標には複数の軸があり、何を目的にするかで効く指標が変わります。「GPUがAIの主役になった理由」を理解した上で、その先の「どこが律速か」まで読めるようになることが重要です。
AIチップの速さには「TOPS(演算速度)」と「メモリ帯域幅(データを動かす速度)」の両方があります。LLMのような大規模モデルの推論では、計算より先にデータを引き出す速度が詰まることが多い。
構造で言うと(投資家向け)も見る
LLM推論は演算強度が低くメモリ帯域幅律速(memory-bound)になりやすい。H100 SXM5ではFP16 FLOPS約1,979 TFLOPSに対しHBM3帯域幅3.35 TB/s。後継GB200はHBM4を22 TB/sまで拡大しており、推論スループットの主な改善源はFLOPSよりHBMの世代更新。推論特化ASICはFLOPSより低精度演算と帯域幅効率に特化する設計になる。
TOPS・FLOPSとは何を測っているのか
AI半導体のスペック表には複数の「速さ」の数字が並んでいます。それぞれの意味を整理します。
FLOPS(フロップス) は Floating-Point Operations Per Second の略で、1秒間にこなせる浮動小数点演算の回数です。TFLOPS は1兆回。深層学習の中心演算である行列積の速度をこれで表します。
TOPS(トップス) は Tera Operations Per Second の略で、1秒間の整数・低精度演算の回数です。エッジAIチップや量子化モデルのスペックで多く使われます。
ここで注意が必要なのが精度(ビット幅)です。FP32(32ビット浮動小数点)からFP16・FP8・INT8へと精度が落ちるほど、同じチップでも数字が大きくなります。NVIDIA H100 SXM5を例にとると、FP32は約67 TFLOPS、AI専用の演算回路を使うFP16は約1,979 TFLOPSと約30倍の差があります。FP8ではさらにその2倍です。比較広告の「○倍高速」という数字が精度ビット幅だけの差のことがあるため、精度を統一せずに比べると意味がありません(NVIDIA)。
なぜLLMの推論ではメモリ帯域幅が律速になるのか
「GPUがAIの主役になった理由」では並列演算の強さを解説しました。では実際のLLM推論でその演算能力が常に使い切れているかというと、そうでないケースが多い。
LLM推論の仕組みを見ると理由がわかります。モデルはトークン(単語のかけら)を1つ生成するたびに、モデルの全パラメータ(重み)をメモリから読み込む処理を繰り返します。GPT-3規模(パラメータ1,750億・FP16)なら1回の生成で約350GBのデータ読み取りが発生し、演算量は相対的に少なくなります。
この「演算量 ÷ データ転送量」の比率を演算強度(算術強度)と呼びます。値が低いとき、計算コアが空いていてもデータが届かず計算が空転します。これがメモリ帯域幅律速(memory-bound)です。
(高帯域幅メモリ)はこのボトルネックを解消するために開発された積層型メモリで、H100 SXM5では3.35 TB/s、後継のGB200では22 TB/sの帯域幅を実現しています。「HBMとCoWoSが先端AI半導体に不可欠な理由」はここにあります(Global X ETFs)。
AIチップの主要指標を整理すると
AI半導体を評価するときに確認すべき5つの指標と、それぞれが効く場面を示します。
| 指標 | 単位 | 何を測るか | 効く場面 |
|---|---|---|---|
| FLOPS(浮動小数点演算速度) | TFLOPS | 行列積などの演算スループット | 学習・大バッチ推論 |
| TOPS(整数・低精度演算速度) | TOPS | INT8/INT4など低精度演算 | エッジAI・量子化モデル |
| メモリ帯域幅 | TB/s | 秒間データ転送量 | LLM推論・KVキャッシュ処理 |
| メモリ容量 | GB | 搭載できるパラメータ量 | 大規模モデル全体の格納 |
| TDP(消費電力) | W | 電力コスト・冷却設計 | 大量稼働時の運用コスト |
NVIDIA H100 SXM5の実数値で確認すると:FP16 FLOPS 約1,979 TFLOPS・HBM3帯域幅 3.35 TB/s・HBM3容量 80GB・TDP 700Wです。後継のGB200(NVL72構成)はHBM4を288GB(72 GPU分合計)・帯域幅22 TB/sに拡大しており、主な改善源はFLOPSよりメモリ容量と帯域幅です(NVIDIA)。
学習と推論で「効く指標」が入れ替わる理由
****ではバッチサイズを大きくして大量の行列積を一括処理します。演算強度が高いため、計算コアの数(FLOPS)が直接スループットに効きます。最先端の学習クラスターでは1クラスターあたり数万GPUが並び、GPU同士をつなぐ高速な通信路と合わせてFLOPSを使い切る設計になっています。
一方、****では1リクエストあたりのトークン数が少なく、バッチサイズも小さいことが多い。演算強度が落ちてメモリ帯域幅律速になります。さらにエージェントAIでは長い会話履歴が必要で、「エージェントAIほどCPUとメモリが重要になる理由」で解説したように、KVキャッシュがメモリ容量を大量に消費します。
「推論特化ASICの設計」ではFLOPSより低ビット精度(INT8・INT4)での高効率演算とメモリ帯域幅効率に特化します。Googleの自社チップTPUの最新世代も推論に最適化され、帯域幅効率の改善を主眼に設計されています。2026年にはがAI計算全体の約3分の2を占めると見込まれており、この評価軸の重要性は増しています(Deloitte)。
KVキャッシュとメモリ容量の関係
LLMが過去の文脈を参照しながら生成する計算では、「KVキャッシュ」と呼ばれる一時データがを占有します。コンテキスト(処理する文章の長さ)が2倍になればKVキャッシュも約2倍に膨らみます。
たとえばGPT-3規模モデル(FP16)ではコンテキスト4,096トークンのKVキャッシュが約1 GB/リクエスト程度です。100リクエストを同時処理すれば100 GBが必要になります。つまり、HBMの容量が同時処理リクエスト数(スループット)の上限を直接決めます。
AIチップの競争力は演算コアの数だけでなく、HBMの世代(HBM2E → HBM3 → HBM4)と容量の積み上げと表裏一体です。2026年以降に本格化するHBM4世代では帯域幅が大幅に向上し、推論スループットの改善が期待されています。
この記事のまとめ
- FLOPS・TOPS・メモリ帯域幅・メモリ容量・TDPがAI半導体評価の5軸。目的によって効く指標が変わる。
- FLOPSは精度ビット幅(FP32/FP16/FP8)によって同じチップでも数十倍変わるため、比較時は精度の統一が必須。
- LLM推論はメモリ帯域幅律速(memory-bound)になりやすく、FLOPSよりHBM帯域幅と容量が速度の上限を決める。
- 学習はFLOPS重視、推論はメモリ帯域幅・コスト効率重視と、目的で評価軸が逆転する。
- AIチップの競争力はHBMの世代更新(HBM2E→HBM3→HBM4)と表裏一体で、帯域幅と容量の拡大が推論性能の主な改善源。
この記事のまとめ
- FLOPS・TOPS・メモリ帯域幅・メモリ容量・TDPがAI半導体評価の5軸。目的によって効く指標が変わる。
- FLOPSは精度ビット幅(FP32/FP16/FP8)によって同じチップでも数十倍変わるため、比較時は精度の統一が必須。
- LLM推論はメモリ帯域幅律速(memory-bound)になりやすく、FLOPSよりHBM帯域幅と容量が速度の上限を決める。
- 学習はFLOPS重視、推論はメモリ帯域幅・コスト効率重視と、目的で評価軸が逆転する。
- AIチップの競争力はHBMの世代更新(HBM2E→HBM3→HBM4)と表裏一体で、帯域幅と容量の拡大が推論性能の主な改善源。
よくある質問(FAQ)
Q.TOPSはどう読みますか?何の略ですか?+
TOPSは「トップス」と読み、Tera Operations Per Second(テラ・オペレーションズ・パー・セコンド)の略です。1秒間に1兆回の演算を処理できることを意味します。AI半導体やエッジAIチップの性能比較でよく使われ、INT8などの低精度(整数)演算を前提とすることが多い点が、浮動小数点演算の速度を示すTFLOPS(テラフロップス)との大きな違いです。
Q.TOPSとTFLOPSはどう違いますか?+
TOPSは整数・低精度演算(INT8など)の速度、TFLOPSは浮動小数点演算の速度です。エッジAIチップはTOPSで、データセンターGPUはTFLOPSで表記することが多い。同じチップでもFP32より低精度(FP16・FP8)の方が数字が大きくなるため、精度ビット幅を合わせないと比較できません。
Q.なぜLLMの推論ではFLOPSよりメモリ帯域幅の方が重要なのですか?+
LLM推論はトークンを1つ生成するたびにモデルの全パラメータ(重み)をメモリから読み込みます。演算量に対してデータ転送量が多いため「演算強度」が低くなり、計算コアが余っていてもメモリが間に合わない「メモリ帯域幅律速(memory-bound)」の状態になりやすい。
Q.NVIDIA H100とGB200のスペックはどう違いますか?+
H100 SXM5はFP16 FLOPS約1,979 TFLOPS・HBM3帯域幅3.35 TB/s・HBM3容量80GB・TDP 700W。後継GB200(NVL72構成)はHBM4容量288GB(72 GPU分)・帯域幅22 TB/sで、メモリが大幅に強化されています。推論スループットの主な改善源はFLOPSよりメモリ帯域幅と容量の拡大です。
Q.エッジAIチップの性能指標はどう読めばよいですか?+
エッジAIでは消費電力あたりのTOPS(TOPS/W=電力効率)が最重要指標です。スマホ向けNPUやカメラ向けチップは絶対的なTOPS値より電力効率で選ばれます。モデルがINT8量子化前提なら、FP16 TFLOPSよりINT8 TOPSで比較します。
用語集
- HBM/ High Bandwidth Memory
- DRAMを積み重ねて広帯域にした高性能メモリ。AI半導体とセットで使われる。
参考資料・引用元
- NVIDIA H100 Tensor Core GPU データシート一次情報NVIDIA(2023)— 使用箇所: H100 SXM5のスペック:FP32約67 TFLOPS・FP16 Tensor Core約1,979 TFLOPS・FP8 Tensor Core約3,958 TFLOPS・HBM3メモリ帯域幅3.35 TB/s・HBM3容量80GB・TDP 700W(要確認・NVIDIAの公式データシートを参照)https://www.nvidia.com/en-us/data-center/h100/
- NVIDIA GB200 NVL72一次情報NVIDIA(2024)— 使用箇所: AIラックの代表例。1ラックに72基のBlackwell GPU+36基のGrace CPU、第5世代NVLink 130TB/s、液冷設計。消費電力は公称約120kW(実装仕様では液冷115+空冷17=約132kW)https://www.nvidia.com/en-us/data-center/gb200-nvl72/
- Memory Is the New Bottleneck in AI Semiconductors調査会社Global X ETFs(2025)— 使用箇所: 大規模推論とエージェントAIではメモリが律速。長い文脈を保持するKVキャッシュがメモリ容量・帯域を消費し、HBM・3D積層DRAMの重要性が上昇https://www.globalxetfs.com/articles/memory-is-the-new-bottleneck-in-ai-semiconductors
- Why AI's next phase will likely demand more computational power, not less(2026予測)調査会社Deloitte(TMT Predictions 2026)(2026)— 使用箇所: 推論が全AI計算に占める割合 2023年約1/3→2025年約半分→2026年約2/3。推論特化チップ市場は2025年200億ドル超→2026年500億ドル超https://www.deloitte.com/us/en/insights/industry/technology/technology-media-and-telecom-predictions/2026/compute-power-ai.html
この記事をシェア
次に読む
コメント
GitHub アカウントでログインしてコメントできます。