より大規模なMoEモデルでは、トークンごとにすべてのパラメータをアクティブ化することなく、対象タスクでより優れた結果を得られる場合があります。
Mixture of Experts(MoE)モデルでは、Denseモデルの一部の層を、特定分野に特化したエキスパートネットワーク群に置き換えます。 Denseモデルでは、層内のすべてのパラメータが各トークンの演算に使用されます。 MoEモデルでは、ルーターが現在のトークンを評価し、関連性の高い少数のエキスパートのみを選択します。これらは一般にTop-Kエキスパートと呼ばれます。そのトークンの演算を実行するのは、選択されたエキスパートのみです。 これにより、MoEモデルは、任意の時点でアクティブ化するパラメータ数を大幅に上回る総パラメータ容量を持つことができます。 モデルやワークロードによっては、同等規模のDenseモデルと同等のアクティブな演算量を必要とせずに、コーディング、推論、ツール利用、多言語処理、ドメイン固有のタスクでより優れた結果を得られる場合があります。
Keep the full model in aiDAPTIV Cache Memory and swap only the experts each token needs into unified memory,
Without aiDAPTIV, the whole AI model must load
into unified memory.
aiDAPTIV offloads the full MoE model to cache and swaps only the needed experts into memory.
Run the same MoE model in roughly half the unified memory – larger models become practical on AI PCs.
特定のトークンの演算に使用されるエキスパートは少数でも、エキスパートプール全体をどこかに保持しておく必要があります。
総パラメータ数が数千億に達するモデルでも、トークンごとにアクティブ化されるのはその一部にすぎない場合があります。アクティブな演算要件は対応可能な範囲でも、全パラメータのメモリフットプリントが利用可能なGPUメモリまたはユニファイドメモリの容量を超える可能性があります。
これがMoEのメモリ問題です。
対応する統合環境では、Pascari aiDAPTIV™はアクティブなエキスパートをコンピュートの近くに保持しながら、利用可能なエキスパートプールをGPUメモリ、システムメモリ、キャッシュメモリにわたって拡張します。
これにより、エキスパートプール全体をGPUメモリまたはユニファイドメモリに収容できないクライアントシステム、ワークステーション、エッジ環境、サーバーでも、より大規模なスパースモデルを実用的に運用できるようになります。
タスクによっては、類似したエキスパート群が繰り返し使用されます。その場合、必要なエキスパートのワーキングセットをより多くコンピュートの近くに保持できます。
一方、ドメイン、言語、コーディングスタイル、ツール、推論モードが短時間で頻繁に切り替わるタスクもあります。その場合、短時間により多くの異なるエキスパートが必要となり、メモリシステム内のデータ移動量が増加します。
これが中心的なパフォーマンス上のトレードオフです。
インタラクティブAIが必ずしも対象外になるわけではありません。適合性は、エキスパートのローカリティ、プラットフォーム構成、およびユーザー体験に求められるレイテンシの一貫性によって異なります。
Disclaimer: When the router selects an expert already resident near compute, the model can continue with minimal additional data movement. When it selects an expert that must be brought forward from system memory or cache memory, computation waits for that expert to arrive.
The outcome depends on platform memory bandwidth, cache memory throughput, PCIe or interconnect bandwidth, model architecture, router behavior, expert locality, prompt diversity, and runtime implementation. A larger MoE is worth using only when its added capability matters to the task. aiDAPTIV expands model capacity; it does not guarantee the latency of a fully GPU-resident model.