AIの推論コストを下げる最大の鍵は、計算を速くすることより「1つの数値を何ビットで表すか」を減らすことです。FP32(32ビット)からFP8、FP4へとビット幅を半分にするたびに、メモリ・データ転送量・消費電力が一気に下がります。これが低精度数値フォーマットと量子化が注目される理由です。

生成AIのコストの大半は、できあがったモデルを動かす「推論」で発生します。そのコストを左右するのは演算回数だけではありません。モデルの中身である膨大な数値を、どれだけ少ないビット数で表せるかが効きます。「AI半導体の性能を決めるのはメモリ帯域幅」であることを踏まえると、数値表現そのものを軽くする意味が見えてきます。本記事ではFP8・FP4・NVFP4という数値フォーマットの中身を、平易に解説します。

ひとことで言うと(初心者向け)

コンピュータは数値をビット(0と1)の組み合わせで表します。AIで使うビット数を32→8→4と減らすと、データが軽くなり、メモリも電力も推論コストも下がります。ただし減らしすぎると精度が落ちるため、グループごとに倍率を持たせる「ブロックスケール」で精度を保ちます。

構造で言うと(投資家向け)も見る
構造で言うと(投資家向け)

低精度化はAI推論コストの主要な低減レバー。NVFP4はFP16比でモデルのメモリ占有を約3.5分の1、FP8比で約1.8分の1に圧縮しつつ、DeepSeek-R1-0528で精度劣化1%以下を達成。Blackwell世代の第5世代Tensor CoreがNVFP4をハードで処理する。フォーマット(NVFP4 vs OCP標準のMXFP4)は今後の互換性とエコシステム競争の焦点になる。

量子化とは何か

量子化とは、数値の精度(ビット幅)を意図的に落として、計算とメモリを軽く・速くする技術です。AIモデルは「重み(パラメータ)」と呼ばれる膨大な数値の集まりで、これを32ビットから8ビットや4ビットへ変換します。

たとえば1,750億パラメータのモデルをFP16(16ビット)で持つと約350GBですが、FP8(8ビット)なら約175GB、FP4(4ビット)なら約88GBまで縮みます。ビット数を半分にすれば、データ量もおおむね半分になるという素直な関係です。

量子化が特に効くのは(できあがったAIに質問して答えを出させる工程)です。では数値の細かい差が結果に影響しやすいため、極端な低精度化は難しい場面が残ります。一方で推論はビットを削っても答えの質を保ちやすく、ここにコスト削減の余地が集中しています。

FP8・FP4はどういう数値表現か

そもそも浮動小数点(フローティングポイント)とは、数を「符号・指数・仮数」の3つの部分で表す方式です。符号はプラスかマイナス、指数は小数点の位置(おおまかな大きさ=表せる範囲)、仮数は数の細かい値(精度)を担います。指数に割くビットが多いほど広い範囲を、仮数に多いほど細かい値を表せます。

フォーマットビット数構成(符号/指数/仮数)特徴
FP32321 / 8 / 23標準的な高精度。学習の基準
FP16161 / 5 / 10精度重視の半精度
BF16161 / 8 / 7範囲はFP32並み・精度は粗い
FP8(E4M3)81 / 4 / 3精度重視のFP8
FP8(E5M2)81 / 5 / 2範囲重視のFP8
FP4(E2M1)41 / 2 / 1約-6〜6しか表せない

FP8の名前にある E4M3・E5M2 は、指数(Exponent)と仮数(Mantissa)のビット数を示します。E4M3は指数4・仮数3ビットで精度を優先、E5M2は指数5・仮数2ビットで表せる範囲を優先します。FP8 Formats for Deep Learning(Micikevicius et al., 2022)は、この2つを使い分けることで16ビット学習と同等の品質を得られることを示しました。一般に、答えを出す方向の計算にはE4M3が、学習時の更新量の計算にはE5M2が向くとされます(要確認:用途配分は実装により異なる)。

FP4 はわずか4ビットで、E2M1(符号1・指数2・仮数1)の構成です。表せる値は約-6〜6の16段階しかありません。これだけでは粗すぎるため、後述のブロックスケールで補うのが前提になります(arXiv:2209.05433)。

なぜ低精度で推論コストが下がるのか

ビット数を減らすと推論コストが下がる理由は、主にメモリにあります。「AI半導体の性能指標の記事」で解説したとおり、大規模言語モデルの推論はトークンを1つ生成するたびに全パラメータをメモリから読み込むため、メモリ帯域幅が速度の上限を決めることが多いのです。

ビット数が半分になれば、メモリに置くデータ量も、メモリから読み出すデータ量もおおむね半分になります。読み出すデータが減れば、その分だけ速くなり、(高帯域幅メモリ)の限られた帯域を有効に使えます。NVIDIAによると、NVFP4はFP16比でモデルのメモリ占有を約3.5分の1、FP8比で約1.8分の1に削減します。

下がるのは時間とメモリだけではありません。しかも、データを動かす量が減れば消費電力も下がります。データセンターのAI電力が問題になるなか、「GPUが大量の電力を使う構造」に対して、低精度化は数値表現の側から効く対策です。推論特化の(特定用途向けチップ)も、こうした低ビット演算を前提に設計されます(NVIDIA Technical Blog)。

精度は落ちないのか

最大の疑問は「ビットを削って精度は落ちないのか」です。素朴に削れば落ちます。FP4は16段階しかないため、ある範囲の数値を一律に4ビットへ押し込めると、大きな外れ値が表現の範囲をはみ出し、誤差が膨らみます。

これを解く鍵がブロックスケールです。数値を小さなグループ(ブロック)に分け、ブロックごとに共通の倍率(スケール)を持たせます。各値はスケールで割ってから4ビットに収め、使うときに掛け戻します。ブロックが小さいほど、その範囲の値に合わせて倍率を調整でき、外れ値の影響を抑えられます。

ここで方式が分かれます。業界団体のOCP(Open Compute Project)が標準化した MXFP4 は、32個ごとに「2のべき乗」のスケールを共有します。一方、NVIDIA独自の NVFP4 は16個ごとに端数まで表せる細かいスケールを持ち、さらにテンソル(数値のひとまとまり)全体にもう一段のスケールを重ねる二段構えです。ブロックが32→16と細かく、スケールが端数まで表せる分、外れ値に強く誤差が小さくなります。

その効果は具体的です。NVIDIAは、公開モデルのDeepSeek-R1-0528をFP8からNVFP4へ量子化しても、主要な言語タスクで精度劣化が1%以下にとどまり、数学ベンチマークのAIME 2024では逆に約2%向上したと報告しています。つまり、4ビットでも、スケール設計次第で実用精度を保てるということです(Open Compute Project)。

今後はどうなるのか

低精度化の流れは、ハードとフォーマットの両面で進みます。NVIDIAの最新世代GPU(Blackwell)は、NVFP4のブロック分割・スケール処理・4ビットの行列計算を、AI計算専用の回路でそのまま自動処理します。フォーマットがチップに焼き込まれることで、量子化はソフトの工夫から標準機能へと移りつつあります。

論点は標準化と互換性です。業界標準のMXFP4と、ベンダー独自で精度に優れるNVFP4が並走しており、どちらがエコシステムの主流になるかは未確定です。また、学習側でも4ビット化の研究が進み、学習と推論の双方で低精度が当たり前になる可能性があります。

数値を何ビットで表すかは、もはや実装の細部ではなく、AI半導体の競争力そのものになりました。「AI半導体とは何か」を理解するうえで、低精度数値フォーマットは欠かせない論点です(Edge AI and Vision Alliance)。

この記事のまとめ

  • 浮動小数点は符号・指数・仮数の3要素で数を表し、FP32→FP16→FP8→FP4とビット数を削るほど軽く速くなる。
  • 量子化とは、精度(ビット幅)を落として計算とメモリを軽くする技術で、AIの推論で特に効く。
  • FP8にはE4M3(精度重視)とE5M2(範囲重視)があり、FP4はE2M1で約-6〜6しか表せないためスケール補正が前提。
  • NVFP4はNVIDIA独自のブロックスケール付きFP4で、16個単位のFP8スケール+テンソル単位のFP32スケールで精度を保つ。
  • NVFP4はFP16比でメモリを約3.5分の1にしつつ、DeepSeek-R1で精度劣化1%以下を実現し、推論コストと電力を下げる。

この記事のまとめ

  • 浮動小数点は符号・指数・仮数の3要素で数を表し、FP32→FP16→FP8→FP4とビット数を削るほど軽く速くなる。
  • 量子化とは、精度(ビット幅)を落として計算とメモリを軽くする技術。AIの推論で特に効く。
  • FP8にはE4M3(精度重視)とE5M2(範囲重視)があり、FP4はE2M1で約-6〜6しか表せないためスケール補正が前提。
  • NVFP4はNVIDIA独自のブロックスケール付きFP4で、16個単位のFP8スケール+テンソル単位のFP32スケールで精度を保つ。
  • NVFP4はFP16比でメモリを約3.5分の1にしつつ、DeepSeek-R1で精度劣化1%以下を実現し、推論コストと電力を下げる。
スポンサーリンク

よくある質問(FAQ)

Q.FP8とFP4とは何ですか?+

FP8は8ビット、FP4は4ビットで1つの数値を表す浮動小数点フォーマットです。AIの計算で使うFP32(32ビット)と比べてビット数が少ないため、メモリ使用量とデータ転送量が大幅に減ります。FP8には精度重視のE4M3(指数4ビット・仮数3ビット)と範囲重視のE5M2(指数5ビット・仮数2ビット)があり、FP4はE2M1(符号1・指数2・仮数1ビット)でおよそ-6〜6の範囲しか表せません。

Q.量子化するとAIの精度は落ちないのですか?+

工夫すれば、ほとんど落ちません。NVIDIAによると、DeepSeek-R1-0528をFP8からNVFP4へ量子化しても主要な言語タスクで精度劣化は1%以下で、一部のベンチマークではむしろ向上しました。鍵は「ブロックスケール」で、数値を小さなグループに分けてグループごとに倍率(スケール)を持たせ、4ビットの狭い表現範囲を効率よく使います。素朴にビットを削るだけだと精度は落ちます。

Q.NVFP4とMXFP4の違いは何ですか?+

どちらも4ビット浮動小数点(E2M1)を共有スケールで補う方式ですが、ブロックの粒度とスケールの形式が違います。MXFP4は32個ごとに2のべき乗(E8M0)のスケールを共有します。NVIDIA独自のNVFP4は16個ごとにFP8(E4M3)のスケールを持ち、さらにテンソル単位のFP32スケールを重ねます。粒度が細かく端数も表せるため、外れ値の影響を抑えて精度を保ちやすい設計です。

Q.なぜ低精度にすると推論コストが下がるのですか?+

ビット数が減ると、同じモデルでもメモリ占有量とメモリから読み出すデータ量が減るためです。大規模言語モデルの推論はメモリ帯域幅が速度の上限を決めることが多く、データ量が減れば速くなります。NVFP4はFP16比でモデルのメモリ占有を約3.5分の1、FP8比で約1.8分の1に減らします。データ移動が減れば消費電力も下がり、1トークンあたりのコストが下がります。

用語集

推論(インファレンス)/ inference
学習済みのAIを実際に使って答えを出す処理。質問に答える・文章を生成するなど、利用時の計算がこれにあたる。
学習(トレーニング)/ training
大量のデータからAIモデルを作り込む処理。膨大な計算力を一度に必要とし、巨大なGPUクラスタを使う。
HBM/ High Bandwidth Memory
DRAMを積み重ねて広帯域にした高性能メモリ。AI半導体とセットで使われる。
ASIC(カスタムチップ)/ Application-Specific Integrated Circuit
特定の用途だけに特化して作る専用チップ。汎用品より無駄がなく、決まった処理を安く・省電力でこなせる。

参考資料・引用元

  1. Introducing NVFP4 for Efficient and Accurate Low-Precision Inference一次情報
    NVIDIA Technical Blog(2025-06-24)— 使用箇所: NVFP4の定義・E2M1構造・16要素ブロック+FP8(E4M3)スケール+テンソル単位FP32スケール・FP16比3.5分の1/FP8比1.8分の1のメモリ削減・DeepSeek-R1で精度劣化1%以下・Blackwell第5世代Tensor Core対応
    https://developer.nvidia.com/blog/introducing-nvfp4-for-efficient-and-accurate-low-precision-inference/
  2. FP8 Formats for Deep Learning (Micikevicius et al.)調査会社
    arXiv:2209.05433(2022-09-12)— 使用箇所: FP8のE4M3(指数4・仮数3)/E5M2(指数5・仮数2)の定義・精度と範囲のトレードオフ・16ビット学習と同等品質という実証
    https://arxiv.org/abs/2209.05433
  3. OCP Microscaling Formats (MX) Specification v1.0業界団体
    Open Compute Project(OCP)(2023-09)— 使用箇所: MXFP4(E2M1)の業界標準仕様・32要素ブロック共有スケール・2のべき乗(E8M0)スケール方式(NVFP4の16要素粒度との対比、要確認・日付概算)
    https://www.opencompute.org/documents/ocp-microscaling-formats-mx-v1-0-spec-final-pdf
  4. NVIDIA Blackwell: The Impact of NVFP4 for LLM Inference報道
    Edge AI and Vision Alliance(2025-10)— 使用箇所: NVFP4のLLM推論への影響・Blackwell世代でのハードウェア処理(ブロック分割/動的スケール/4ビット行列演算)の整理(要確認)
    https://www.edge-ai-vision.com/2025/10/nvidia-blackwell-the-impact-of-nvfp4-for-llm-inference/

この記事をシェア

XFacebookLINEB!はてブ

コメント

GitHub アカウントでログインしてコメントできます。