系統最快的記憶體,應該存放模型現在需要的資料,而不是應用程式稍後可能需要的每一項 AI 狀態。這通常包括模型元件、使用中的 KV 快取與MoE 專家、activation,以及即時運算所需的其他資料。
快速記憶體有限。模型權重、上下文與作用中應用程式狀態競爭該容量時,系統必須移除或重新運算資料,或是將資料移至其他地方。
Orchestrates AI data across GPU, DRAM, and flash memory.
Orchestrates AI data across GPU, DRAM, and flash memory.

Specialized high-speed, high-endurance SSD optimized for AI workloads.
新式 AI 系統未必都有獨立的 GPU VRAM 與系統 DRAM。
在獨立 GPU 系統,GPU 記憶體與系統記憶體是實體上彼此獨立的記憶體層。GPU 記憶體是高速層,系統記憶體可以為暫存或近期資料提供中繼容量。
在統一記憶體系統,CPU 與加速器共用同一個實體記憶體池作為高速層。在 Intel、AMD、NVIDIA 與 Apple 生態系的用戶端與伺服器平台,都有這類架構的不同版本。
實體配置雖然不同,但限制仍然相同:模型權重、作用中上下文與應用程式狀態,都在競爭運算位置附近最快的記憶體。
在支援的情況下,aiDAPTIV 快取記憶體作為較大的保留容量層,可用於兩種架構的用戶端、工作站、邊緣與伺服器配置。這讓支援的 AI 執行階段有更多空間保留符合條件的 AI 狀態。使用中的資料會留在最快的可用記憶體,較少使用的狀態則可留在較大且較慢的層級,而不是立即丟棄這些資料,稍後再重建。
在支援的訓練整合中,aiDAPTIV 可以透過 GPU 記憶體、系統記憶體與快取記憶體,暫存模型與訓練狀態,而無須將完整的工作集一次全部保留在 GPU 記憶體中。
確切處理方式因模型、執行階段、訓練方法、硬體配置、序列長度與批次大小而異。視工作負載而定,資料可能會被保留、在記憶體系統中移動,或是重新運算,在容量與執行時間之間取得平衡。
AI 狀態的緊急程度不盡相同。
可重複使用的 KV 快取前綴可能很有價值,因為相容的後續請求可以避免重複的預填充工作。MoE 專家可能在當前 Token 時未被啟用,但幾個 Token 後可能再次被使用。隨著訓練工作進行,微調狀態可能需要在系統中移動。
aiDAPTIV 將這些工作負載視為具有不同時間與重複使用特徵的 AI 資料,而不是無差異的記憶體分頁。
aiDAPTIV 讓第三個選項在支援的工作負載派上用場。它將即時工作留在靠近運算的位置,將符合條件但較少使用的狀態保留在更大的層級,並在工作負載再次需要時將該狀態移回。
確切放置位置因模型、執行階段與任務而異。運作原則依舊簡單:將高速記憶體保留給即時工作,然後使用較低的層級擴充容量並保留有用的狀態。
從較低層級移動資料需要時間。aiDAPTIV 無法消除延遲,也無法讓快閃記憶體等同於 GPU 記憶體。
它的價值在於讓規模更大或更持久的 AI 任務變得實用,避免不必要的重新運算,並讓稀缺的高速記憶體專注於當前的工作。
問題不在於快取記憶體是否與 GPU 記憶體一樣快。關鍵問題在於,記憶體架構是否讓您在打算部署的系統上,實際執行預期的 AI 任務。
Swap 將記憶體視為無差別的分頁。
AI 狀態並非無差別。可重複使用的 Token 前綴、非作用中的 MoE 專家與訓練活化值,都有不同的價值與時間要求。
aiDAPTIV 管理這些差異,而不僅僅是將位元組移至儲存空間。
功能因執行階段與版本、作業系統、GPU 或統一記憶體平台、模型架構、系統記憶體配置、快取記憶體配置,以及 AI 任務本身而異。