最新のAIでは、コンピュートリソースが不足する前に、メモリの壁に直面することが少なくありません。
Pascari aiDAPTIV™は、クライアントPC、ワークステーションからエッジ環境、サーバーまでカバーすることが可能な、生成AIシステム向けに設計されたファイソンの専用ソリューションです。aiDAPTIVミドルウェアとaiDAPTIV キャッシュメモリを組み合わせることで、GPUメモリ、システムメモリ、専用フラッシュメモリの各容量階層を制御し、AIで利用可能なメモリを拡張します。
より大規模なモデルを実行でき、より多くのコンテキストを保持することが可能になります。
メモリが制約要因になると、コンテキストが切り詰められ、有用なモデルがメモリに収まらなくなったり、システムがすでに処理した情報を繰り返し処理したりします。その結果、スループットが大幅に低下します。
メモリが制約要因になると、コンテキストが切り詰められ、有用なモデルがメモリに収まらなくなったり、システムがすでに処理した情報を繰り返し処理したりします。その結果、スループットが大幅に低下します。
aiDAPTIVミドルウェアは、対応するランタイムにおいて、アクティブなAI状態をコンピュートの近くに保持し、アクティブ度の低い状態をより大容量のメモリ階層に保持して、再び必要になったときに呼び戻せるようにします。
aiDAPTIV キャッシュメモリは、高速メモリに常駐させると、より優先度の高い処理を圧迫するメモリ情報を拡張メモリ側にキャッシュアウトするための専用フラッシュ容量階層です。
メモリ階層 | 主な役割 | 代表的なデータ例 |
|---|---|---|
GPUメモリまたはユニファイドメモリ | 即時演算 | アクティブなモデル状態、アクティブなKVキャッシュ、アクティブなエキスパート、現在のトレーニングレイヤー |
システムメモリ | ディスクリートGPUシステムにおけるステージングおよび容量拡張 | プリフェッチされたデータ、中間キャッシュ、近日中に必要となる可能性が高い状態 |
aiDAPTIV キャッシュメモリ | 保持容量 | アクティブ度の低いKVキャッシュ、コールドなエキスパート、ステージングされたモデルまたはトレーニングデータ |
GPUメモリまたはユニファイドメモリ
即時演算
アクティブなモデル状態、アクティブなKVキャッシュ、アクティブなエキスパート、現在のトレーニングレイヤー
システムメモリ
Staging and expanded capacity on
discrete-GPU systems
Prefetched data, intermediate cache, state likely to be needed soon
aiDAPTIV キャッシュメモリ
保持容量
アクティブ度の低いKVキャッシュ、コールドなエキスパート、ステージングされたモデルまたはトレーニングデータ
長いプロンプト、RAG、またはドキュメントの反復処理により、最初のトークンまでの時間が長くなる
スパースMoEモデルが利用可能なメモリに収まらない
ファインチューニングがメモリ不足エラーで終了する
モデルまたはコンテキスト全体がメモリに収まらず、どのメモリ制限が原因かわからない
NeweggでaiDAPTIVを搭載したABSシステムを見る