システムの最も高速なメモリには、アプリケーションが後で必要とする可能性のあるすべてのAI関連データではなく、モデルが現時点で必要とするデータを保持する必要があります。通常、これにはモデルコンポーネント、アクティブなKVキャッシュ、アクティブなMoEエキスパート、アクティベーション、および即時の演算に必要なその他のデータが含まれます。
高速メモリの容量には限りがあります。モデルの重み、コンテキスト、アクティブなアプリケーション状態がその容量を奪い合うと、システムはデータを削除または再計算するか、別の場所に移動する必要があります。
Orchestrates AI data across GPU, DRAM, and flash memory.
Orchestrates AI data across GPU, DRAM, and flash memory.

Specialized high-speed, high-endurance SSD optimized for AI workloads.
最新のAIシステムのすべてが、個別のGPU VRAMとシステムDRAMを備えているわけではありません。
ディスクリートGPUシステムでは、GPUメモリとシステムメモリは物理的に分離された階層です。GPUメモリは高速階層として機能し、システムメモリはステージングや近い将来に必要となるデータのための中間容量を提供できます。
ユニファイドメモリシステムでは、CPUとアクセラレータが共通の物理メモリプールを共有し、このプールが高速階層として機能します。Intel、AMD、NVIDIA、Appleの各エコシステムでは、クライアントおよびサーバープラットフォームで、これらのアーキテクチャの異なるバージョンが使用される場合があります。
物理構成は異なっても、制約は同じです。モデルの重み、アクティブなコンテキスト、アプリケーション状態が、コンピュートの近くにある最も高速なメモリを奪い合います。
aiDAPTIV キャッシュメモリは、両方のアーキテクチャにおいて、対応するクライアント、ワークステーション、エッジ、サーバー構成で、より大容量の保持容量階層として機能します。これにより、対応するAIランタイムでは、対象となるAI状態を保持できる領域が拡張されます。アクティブなデータは利用可能な最も高速なメモリに保持され、アクティブ度の低い状態は完全に破棄して後で再構築するのではなく、より大容量で低速な階層に保持できます。
aiDAPTIVTMが対応するトレーニング統合環境では、ワーキングセット全体をGPUメモリに同時に保持するのではなく、モデルおよびトレーニングに必要なメモリをGPUメモリ、システムメモリ、キャッシュメモリにわたってステージングできます。
具体的な処理方法は、モデル、ランタイム、トレーニング手法、ハードウェア構成、シーケンス長、バッチサイズによって異なります。ワークロードに応じて、容量と実行時間のバランスを取るために、データを保持したり、メモリシステム内で移動したり、再計算したりする場合があります。
すべてのAI処理状態が同じ緊急度を持つわけではありません。
再利用可能なKVキャッシュのプレフィックスには、互換性のある後続リクエストでプリフィル処理の繰り返しを回避できるという価値があります。MoEエキスパートは、現在のトークンでは非アクティブでも、数トークン後に再び必要になる場合があります。ファインチューニングの状態は、トレーニングジョブの進行に伴ってシステム内を移動する必要があります。
aiDAPTIVは、これらのワークロードを画一的なメモリページとしてではなく、タイミングや再利用特性が異なるAIデータとして扱います。
aiDAPTIVは、対応するワークロードで3つ目の選択肢を実用化します。即時処理をコンピュートの近くに維持し、対象となるアクティブ度の低い状態をより大容量の階層に保持して、ワークロードで再び必要になったときにその状態を高速階層へ移動します。
具体的な配置は、モデル、ランタイム、タスクによって異なります。動作原理はシンプルです。高速メモリを即時処理用に確保し、下位階層を使用して容量を拡張し、有用な状態を保持します。
下位階層からのデータ移動には時間がかかります。aiDAPTIVはレイテンシをなくすものではなく、フラッシュをGPUメモリと同等にするものでもありません。
その価値は、より大規模または長時間にわたるAIタスクを実用化し、不要な再計算を回避するとともに、限られた高速メモリを即時処理に集中させることにあります。
問うべきなのは、キャッシュメモリがGPUメモリと同等の速度かどうかではありません。重要なのは、そのメモリアーキテクチャによって、導入予定のシステム上で目的のAIタスクを実用的に実行できるかどうかです。
swapは、メモリを画一的なページとして扱います。
AI状態は画一的ではありません。再利用可能なトークンプレフィックス、非アクティブなMoEエキスパート、トレーニング時のアクティベーションでは、それぞれ価値やタイミング要件が異なります。
aiDAPTIVは、単にバイトデータをストレージへ移動するのではなく、こうした違いを考慮して管理します。
機能は、ランタイムとそのバージョン、オペレーティングシステム、GPUまたはユニファイドメモリプラットフォーム、モデルアーキテクチャ、システムメモリ構成、キャッシュメモリ構成、およびAIタスク自体によって異なります。