「GPU・AI半導体基礎」で扱ったように、AIの学習・を支えるのは、大量の掛け算・足し算を並列にこなす計算専用チップだ。NVIDIAのGPUが支配するこの市場で、Cerebrasが採った戦略は「同じ土俵に乗らない」というものだった。
Cerebrasは「ウェハー1枚まるごと1チップ」というAIチップを作っている会社です。普通のチップは小さく切って作りますが、Cerebrasはあえて大きいまま使い、コア数やメモリを桁違いに多くすることでAI学習を高速化しています。
構造で言うと(投資家向け)も見る
Cerebras Systems(非上場・2016年創業)のWSE-3はTSMC N5製造・4兆トランジスタ・90万AIコア・44GB SRAM・帯域約900TB/s。冗長コア設計で歩留まり問題を解消。CS-3システム1台約240kW。GPUクラスターのInfiniBand通信ボトルネックをオンチップSRAMで排除するアーキテクチャ。HPC・研究機関向けのニッチ市場で差別化。TSMCに製造委託するファブレス設計。NVIDIAのエコシステム優位との競争構造の中で、超大規模学習ワークロードの特定領域に集中する戦略。
なぜ「チップは小さく作る」のが常識なのか
半導体の製造プロセスでは、シリコン上にパターンを焼き付け、最後にウェハーをダイ(チップ)単位に切り出す。どんなに高度なプロセスでも、ウェハー上には微細な欠陥(ダスト・結晶欠陥)がランダムに存在する。
ダイが小さければ小さいほど、1枚のウェハーから取り出せるダイの数が増え、かつ1ダイ内に欠陥が入り込む確率が下がる。これが——良品率——を高める基本原理だ。スマートフォン向けSoCが指の爪ほどの面積に収まるのも、コストと歩留まりを最適化した結果である。
この常識に真っ向から挑戦したのが、2016年創業のCerebras Systemsだ。
WSEとは何か——ウェハー全面を1枚のチップとして使う
Cerebrasが開発したWSE(Wafer-Scale Engine)は、300mmウェハーを切り出さずにそのまま1チップとして使う。チップ面積は約46,000mm²——通常のGPU(約800mm²)の約57倍、スマートフォン向けSoC(約100〜200mm²)の数百倍に相当する。
最新世代のWSE-3(2024年発表)のスペックを示す。
| 項目 | WSE-3 | H100(80GB SXM)参考 |
|---|---|---|
| 数 | 約4兆個 | 約800億個 |
| AIコア数 | 900,000 | 16,896 CUDA Core等 |
| オンチップSRAM | 44 GB | 50 MB(L2キャッシュ) |
| チップ内帯域 | 約900 TB/s | 約3.35 TB/s |
| 製造プロセス | TSMC N5(5nm) | TSMC N4(4nm) |
| ダイ面積 | 約46,000 mm² | 約814 mm² |
(Cerebras公式・各社技術資料より。比較値はアーキテクチャが異なるため直接比較には注意が必要。)
トランジスタ数はH100の約50倍に達する。チップ内に直接載せた超高速メモリ(オンチップSRAM)はH100が内蔵する同種メモリの約880倍、チップ内帯域は約270倍だ。
歩留まり問題をどう解決したのか
WSEの最大の技術的難所が歩留まりだ。チップ面積が46,000mm²になると、欠陥が1か所でも存在すれば全体が不良になる——通常の設計ならそうなる。
Cerebrasの解決策は冗長コア設計だ。製造時に必要数よりも多くのコアを搭載しておき、出荷前の検査で欠陥コアを特定して論理的に無効化する。WSE-3で公称する90万コアは、すでに欠陥コアを除外した後の動作保証数であり、製造時にはそれ以上のコアが搭載されている。
この手法は、他のメモリチップが不良セルを冗長セルで代替するのと本質的に同じだ。ただし、通常のメモリチップが代替するのはメモリセル単位であるのに対し、WSEはプロセッサコア単位で行っている点がスケールとして異例だ。
結果として、ウェハー全面を使いながらも実用的な歩留まりを実現している(Cerebras)。
GPUクラスターの何が問題なのか——通信ボトルネック
「NVIDIAのCUDA」で支配されるGPUクラスターは、大規模モデルのにあたり複数のGPUにパラメータを分散して処理する。この際、GPU同士が計算途中の結果をやり取りするために専用の高速ネットワークを使うが、これが通信ボトルネックになることがある。
特に大規模言語モデル(LLM)は、モデルサイズが大きくなるほどGPU間通信の比率が増える。その結果、計算効率(理論性能に対して実際に引き出せる性能の割合)が低下する傾向にある。
WSEはこの問題を設計段階から排除する。44GBのSRAMと約900TB/sのオンチップ帯域があれば、多くのモデルのパラメータをチップ内に完全に収められる。GPU間をまたぐ通信が不要になるため、通信待機による計算効率の低下が生じにくい。
「カスタムAIチップ」のGoogleがTPUを分散学習向けに最適化したように、Cerebrasもまた「通信コストを最小化する」という同一の問題に対して、アーキテクチャのレベルで異なる答えを出したといえる。
CS-3システム——ハードウェア全体の設計
WSE-3を搭載した完成システムが**CS-3(Cerebras CS-3)**だ。ウェハーを単体で使うだけでなく、冷却・電源・インターフェースを含めたシステムとして設計されている。
1台あたりの消費電力は約240kWとされており、通常のGPUサーバー1台(数kW〜数十kW)と比べると大きい。しかし複数のGPUサーバー群が担うワークロードを1台で処理できる場合、トータルの電力・スペース・管理コストが有利になるケースもある。
顧客として公表されているのは、米国のスーパーコンピューターセンターであるアルゴンヌ国立研究所とローレンス・リバモア国立研究所、そして創薬研究を行うAstraZenecaなどだ。超大規模な学習ワークロードを少ない物理台数で処理したい組織が主なターゲットとなっている。
CerebrasはTSMCに製造委託するファブレス企業
Cerebrasは設計専業の企業であり、製造は最大手のTSMCに委託している。WSE-3の製造プロセスはTSMC N5(5nm世代)だ。
300mmウェハー1枚がそのまま1チップになるため、1枚のウェハーから1製品しか得られない。通常は1枚のウェハーを数百〜数千ダイに切り出すことを考えると、製造コスト面では不利な構造だが、代わりに他社にはない単体チップのスペックを実現している。
「UMC・SMIC・GlobalFoundries」といった他のファウンドリは成熟プロセスに特化している。一方でWSEのような最先端・超大面積ダイはTSMCでなければ製造できない。この点でも、Cerebrasのビジネスモデルはシリコンサプライチェーンの頂点に依存している。
限界とCerebrasの立ち位置
WSEアプローチには明確な限界もある。
最大の課題はスケールアウトの難しさだ。複数のCS-3を並列接続する場合、結局はノード間通信が必要になり、単一チップ内完結のメリットが薄れる。GPU同士を高速につなぐ専用の接続技術とソフトウェアを丸ごと揃えたNVIDIAに対し、エコシステムの厚さでは分が悪い。
また、汎用性の低さも課題だ。「推論特化チップ」との比較でも、WSEは超大規模学習に偏ったアーキテクチャで、推論・エッジ・リアルタイム処理には過剰設計になりがちだ。
それでも、Cerebrasが示したのは「設計の前提そのものを疑うことが新しい市場を生む」という教訓だ。AIチップを小さく作る常識は、大規模モデルの時代には唯一の正解ではない——WSEはその実証例として、半導体設計の思考実験として語り続けられるだろう。
この記事のまとめ
- CerebrasのWSE(ウェハースケールエンジン)は300mmウェハー1枚を1チップとして使う異端の設計で、最新WSE-3は4兆トランジスタ・90万AIコア・44GB SRAM・帯域約900TB/s(TSMC N5製造)。
- 通常のチップが小さく作られる主因は歩留まり(不良率抑制)だが、WSEは冗長コア設計で欠陥を吸収し、巨大チップの歩留まり問題を実用レベルに解決した。
- GPUクラスターが複数ノード間でメモリを分散する際に発生する通信ボトルネックを、WSEはオンチップの超広帯域SRAMで回避する。大規模モデルの学習速度で優位性を持つ。
- CS-3システム1台あたりの消費電力は約240kWと大きく、価格も高い。汎用性・エコシステムではNVIDIA GPUが依然優位で、HPC・研究機関・特定ワークロード向けのニッチ市場を狙う戦略。
- 製造はTSMCに委託。設計専業(ファブレス)のCerebrasが唯一無二のアーキテクチャを持ち、GPUとは異なる軸でAI半導体市場に切り込む存在として注目されている。
よくある質問(FAQ)
Q.Cerebrasとはどんな会社ですか?+
Cerebrasは2016年にカリフォルニア州サニーベールで創業されたAI半導体スタートアップです。CEO Andrew Feldmanが率い、「ウェハー1枚を丸ごと1チップ」とするWSE(ウェハースケールエンジン)を独自開発しています。大規模言語モデルの学習・推論において、従来のGPUクラスターとは異なるアーキテクチャを提供しており、アルゴンヌ国立研究所などの大型HPCセンターへの納入実績を持ちます。
Q.WSE(ウェハースケールエンジン)はなぜ普通のチップと違うのですか?+
通常の半導体チップは300mmウェハーを数百〜数千枚のダイに切り分けて製造します。ダイを小さくするほど欠陥による不良率が下がり、歩留まり(良品率)が高まるためです。Cerebrasのアプローチはこの逆で、ウェハー全面を1枚のチップとして使います。その分だけコアの絶対数と搭載メモリ・帯域が桁違いになりますが、1か所でも欠陥があればチップ全体が不良になるリスクがあります。この問題を冗長コア設計で解決しています。
Q.歩留まり問題をどうやって解決しているのですか?+
WSEは90万コア(WSE-3の場合)の中に意図的に余分なコアを組み込んでいます。製造後に欠陥コアを検査で特定し、その部分を論理的に無効化してから出荷します。これにより、ウェハーの特定箇所に欠陥があっても動作するコア数がわずかに減るだけで済み、チップとして機能します。この冗長コア方式により、大型チップが持つ欠陥リスクを実用的な歩留まりまで抑えています。
Q.CerebrasのWSEはGPUと比べて何が得意で何が苦手ですか?+
WSEはオンチップSRAM(チップ内に直接載せる超高速メモリ)を大量(WSE-3で44GB)に搭載し、チップ内帯域が約900TB/sと圧倒的に広いため、大規模モデルのパラメータをオンチップに乗せて超高速に処理できます。特に大規模言語モデルの学習・推論で高い効率を発揮します。一方、1システムあたりの電力消費が約240kWと大きく、価格も高いため、汎用のGPUクラスターに比べて導入ハードルが高い点が課題です。ゲームグラフィックスやリアルタイム推論など汎用性の広い用途ではGPUのエコシステムが依然として優位です。
Q.どのような顧客がCerebrasのシステムを使っていますか?+
アルゴンヌ国立研究所(Argonne)やローレンス・リバモア国立研究所(Lawrence Livermore)などの米国スーパーコンピューターセンター、製薬大手のAstraZenecaなどが導入事例として挙げられています。学術研究や創薬シミュレーションなど、超大規模な学習ワークロードを少ない物理台数で処理したいユーザーに採用されています。
用語集
- ウェハー/ wafer
- 半導体を作る土台となる円盤状のシリコン。ここに多数のチップをまとめて作る。
- トランジスタ/ transistor
- 電気のスイッチ。オン/オフで「0と1」を表し、計算と記憶の最小単位になる。
- 推論(インファレンス)/ inference
- 学習済みのAIを実際に使って答えを出す処理。質問に答える・文章を生成するなど、利用時の計算がこれにあたる。
- ファウンドリ/ foundry
- 他社が設計した半導体を、受託して製造する工場。代表はTSMC。
- 学習(トレーニング)/ training
- 大量のデータからAIモデルを作り込む処理。膨大な計算力を一度に必要とし、巨大なGPUクラスタを使う。
- ファブレス/ fabless
- 自社で工場を持たず、設計だけを行う会社。製造はファウンドリに委託する。
- 歩留まり/ yield ヨミ:ぶどまり
- 1枚のウェハーから取れるチップのうち、欠陥のない良品の割合。
参考資料・引用元
- Cerebras CS-3 System — Product Overview一次情報Cerebras Systems(2024)— 使用箇所: CS-3システムの概要(WSE-3搭載・約240kW・顧客事例(Argonne・Lawrence Livermore・AstraZeneca等)(要確認・Cerebras公式)https://cerebras.ai/product-system/
- Cerebras Wafer-Scale Engine 3 (WSE-3) — Technical Details一次情報Cerebras Systems(2024)— 使用箇所: WSE-3の技術仕様:4兆トランジスタ・900,000 AI最適化コア・44GB SRAM・帯域約900TB/s・TSMC N5プロセス・冗長コアで歩留まり問題を解決(要確認・Cerebras公式)https://cerebras.ai/blog/cerebras-wse-3
この記事をシェア
次に読む
コメント
GitHub アカウントでログインしてコメントできます。