aiDAPTIV TM

オンプレミスで実現する、プライベートかつ高速なLLM 推論と大規模学習

概要

メモリが限界に達すれば、コンピュートだけでは不十分

最新のAIでは、コンピュートリソースが不足する前に、メモリの壁に直面することが少なくありません。

Pascari aiDAPTIV™は、クライアントPC、ワークステーションからエッジ環境、サーバーまでカバーすることが可能な、生成AIシステム向けに設計されたファイソンの専用ソリューションです。aiDAPTIVミドルウェアとaiDAPTIV キャッシュメモリを組み合わせることで、GPUメモリ、システムメモリ、専用フラッシュメモリの各容量階層を制御し、AIで利用可能なメモリを拡張します。

より大規模なモデルを実行でき、より多くのコンテキストを保持することが可能になります。

AIワークロードには、想像以上のメモリが必要です。

メモリが制約要因になると、コンテキストが切り詰められ、有用なモデルがメモリに収まらなくなったり、システムがすでに処理した情報を繰り返し処理したりします。その結果、スループットが大幅に低下します。

モデルの重みは、最初のプロンプトが処理される前からメモリ容量を消費します。

KVキャッシュは、会話、ドキュメント、取得したコンテキストの増加に伴って拡大します。 

エージェントワークフローでは、複数のステップにわたって、指示、ツール、観測結果、作業用アーティファクトが保持されます。

MoEモデルでは、各トークンでアクティブになるのは一部のエキスパートのみですが、エキスパートプール全体を利用可能な状態にしておく必要があります。

ファインチューニングでは、勾配テンソル、オプティマイザ状態、アクティベーション、トレーニングデータが追加されます。

メモリが制約要因になると、コンテキストが切り詰められ、有用なモデルがメモリに収まらなくなったり、システムがすでに処理した情報を繰り返し処理したりします。その結果、スループットが大幅に低下します。

AIデータ向けに構築されたメモリシステム

aiDAPTIVミドルウェアは

aiDAPTIVミドルウェアは、対応するランタイムにおいて、アクティブなAI状態をコンピュートの近くに保持し、アクティブ度の低い状態をより大容量のメモリ階層に保持して、再び必要になったときに呼び戻せるようにします。

aiDAPTIV キャッシュメモリ

aiDAPTIV キャッシュメモリは、高速メモリに常駐させると、より優先度の高い処理を圧迫するメモリ情報を拡張メモリ側にキャッシュアウトするための専用フラッシュ容量階層です。 

メモリ階層
主な役割
代表的なデータ例 
GPUメモリまたはユニファイドメモリ
即時演算
アクティブなモデル状態、アクティブなKVキャッシュ、アクティブなエキスパート、現在のトレーニングレイヤー
システムメモリ
ディスクリートGPUシステムにおけるステージングおよび容量拡張
プリフェッチされたデータ、中間キャッシュ、近日中に必要となる可能性が高い状態
aiDAPTIV キャッシュメモリ
保持容量
アクティブ度の低いKVキャッシュ、コールドなエキスパート、ステージングされたモデルまたはトレーニングデータ
Memory Tier

GPUメモリまたはユニファイドメモリ

主な役割

即時演算

代表的なデータ例 

アクティブなモデル状態、アクティブなKVキャッシュ、アクティブなエキスパート、現在のトレーニングレイヤー

Memory Tier

システムメモリ

主な役割

Staging and expanded capacity on
discrete-GPU systems

代表的なデータ例 

Prefetched data, intermediate cache, state likely to be needed soon

Memory Tier

aiDAPTIV キャッシュメモリ

主な役割

保持容量

代表的なデータ例 

アクティブ度の低いKVキャッシュ、コールドなエキスパート、ステージングされたモデルまたはトレーニングデータ

aiDAPTIVが実現すること

より多くのコンテキストを保持。再構築を削減。
より高性能なモデルをローカルで実行
より大規模なモデルをローカルで適応
メモリ制限により起こりうる問題 ?
対応策案 

長いプロンプト、RAG、またはドキュメントの反復処理により、最初のトークンまでの時間が長くなる 

スパースMoEモデルが利用可能なメモリに収まらない

ファインチューニングがメモリ不足エラーで終了する 

モデルまたはコンテキスト全体がメモリに収まらず、どのメモリ制限が原因かわからない 

aiDAPTIVで構築

AIアプリケーションを構築していますか?
プラットフォームまたはシステムを構築していますか?
技術情報をお探しですか?
構築済みワークステーションをお探しですか?

NeweggでaiDAPTIVを搭載したABSシステムを見る 

SEAMLESS INTEGRATION

  • Optimized middleware to extends GPU memory capacity
  • 2x 2TB aiDAPTIVCache to support 70B model
  • 低遅延

HIGH ENDURANCE

  • 業界をリードするDWPD 5 年以内に 1 日あたり 100 回の書き込み
  • 高度な NAND 修正アルゴリズムを備えた SLC NAND

aiDAPTIV+ BENEFITS

  • 簡単に実装
  • AI アプリケーションを変更する必要はありません
  • Reuse existing HW or add nodes

aiDAPTIV+ MIDDLEWARE

  • モデルを分割して各GPUに割り当てる
  • Hold pending slices on aiDAPTIVCache
  • Swap pending slices w/ finished slices on GPU

FOR SYSTEM INTEGRATORS

  • Access to ai100E SSD
  • Middleware library license

  • Full Phison support to bring up