「メモリが1万倍必要になるかも」…Exynosのキム・ジニョン代表が診断するAI時代のメモリボトルネック
AI時代の到来によりデータ処理量とモデルの規模が急増しており、メモリ需要が爆発的に増加しています。Exynosのキム・ジニョン代表は、AIインフラの核心はメモリであり、CXLを活用したMemory Poolingなどの技術が重要になると指摘しています。
人工知能(AI)時代が本格化するにつれ、データ処理量とモデルの規模が幾何級数的に大きくなることで、メモリ需要が急増している。特にAIが生成するデータが増え、対話の文脈を維持するためのメモリ要求量が増大しているため、従来の方法ではメモリのボトルネック現象を解決するのが難しいという警告が出ている。
YouTubeチャンネル「アンダースタンディング:世界のあらゆる知識」で公開された映像によると、半導体スタートアップExynosのキム・ジニョン代表は、AIインフラの中心にメモリがあると診断した。キム代表は「AIは人類が積み上げてきたデータから価値を見つけ出すツール」とし、「より多くのデータを蓄積して演算しなければ利益を得られないため、これを支える膨大なインフラ投資が必要であり、その核心はメモリである」と説明した。
モデル・ユーザー・コンテキストの急増…「メモリ需要が1万倍に増加する可能性」
キム代表は、AI時代にメモリ需要が爆発する理由として4つの核心要素を挙げた。▲AIモデルサイズの拡大 ▲ユーザー数の増加 ▲入力データ(コンテキスト)の長さの幾何級数的な増加 ▲複数のモデルが協業する「Agentic AI」時代の到来だ。これらの要素はそれぞれ独立して増加するのではなく、互いに掛け合わされる方式で作用するため、メモリ要求量は算術級数的ではなく幾何級数的に増える。
特にキム代表は「一つの答えを得るための中間段階の成果物がメモリに継続的に蓄積されなければならない構造でAIが設計されている」とし、「過去には人が入力したものだけを記憶すればよかったが、今ではAIが出した答えとその文脈まで全て記憶しなければならないため、メモリがはるかに多く必要になる」と述べた。彼は過去の専門家の見解を引用し、「メモリが1,000倍ほどもっと必要になるかもしれないという話もあるが、現在の発展速度を考慮すれば、1,000倍も保守的な数値である可能性がある」と展望した。
このような需要の急増は「Key-Value Cache」技術の重要性へとつながる。Key-Value Cacheは、GPUが毎回同じ演算を繰り返さないように、以前の演算結果をメモリに保存しておいて再利用する技術だ。キム代表は「GPUの演算は非常に高価で時間がかかるため、一度計算したものをメモリに保存して参照する方式が効率的である」とし、「対話が長くなるほどより多くのKey-Value Cacheが必要となり、これはすなわち メモリ容量の圧迫に直結する」と説明した。実際にユーザーとの対話が長くなるほど、以前の内容を記憶するためのKey-Value Cacheの参照量が増え、これがインフラの効率性を決定づける核心要素となる。
CXLベースの「Memory Pooling」でクラウドの効率性を2倍に高める
現在、AIインフラの核心的なソリューションであるHBM(高帯域幅メモリ)は、GPUとメモリを物理的に近くに配置してデータ転送速度(帯域幅)を極大化させた技術だ。しかし、HBMはGPUチップと同じパッケージ内に入らなければならないため、容量を無限に増やすことには限界がある。これに対する代替案として注目されている技術が、まさにCXLである。
CXLは、CPU、GPUなど様々なデバイスを一つに接続する次世代の接続標準だ。Exynosが注力している技術は、CXLを活用して複数のサーバーがメモリを一つの共有空間のように分け合う「Memory Pooling」技術だ。映像によると、既存のクラウド環境のメモリ活用率は平均35%水準に留まっている。Exynosの技術を適用すれば、この活用率を最大で2倍近くまで引き上げることができる。
キム代表は「データをコピーして移動させなくても、必要なサーバーが共有されたメモリに直接アクセスできるようにすることで、同一の性能を半分の設備投資(CAPEX)で確保できる」と説明した。CXL 3.0をサポートするCPUや製品が今年末または来年初めから市場に投入される予定であるため、本格的な市場開花段階に進入するものと見られる。
データ移動を最小化する知能型メモリチップ「MX1」戦略
Exynosは、メモリ容量の拡張だけでなく、データ移動量そのものを減らす戦略も並行して進めている。その核心は、メモリの近くで必要なデータだけをフィルタリングし、簡単な演算まで遂行する知能型メモリチップ「MX1」だ。
従来の方法は、大量のデータを一つ一つ演算装置(GPUなど)へと運び運ばなければならなかったが、MX1を活用すればメモリ段階でデータを一次的に処理することができる。これにより、インフラ全体のデータボトルネック現象を緩和し、効率性を高めるという構想だ。キム代表は、現在データセンターが直面している最大のボトルネックを即座に解決できる技術に集中していると明らかにした。
0コメント
現在コメントの投稿は無効になっています。