微調可能在算力用盡之前,就先發生記憶體不足的問題。
訓練任務需要的記憶體不只有模型權重。它還需要梯度、最佳化器狀態、活化值、中間資料、輸入序列與批次。
增加模型大小、序列長度或批次大小,高速記憶體就可能在系統尚未用盡運算能力之前耗盡。
Pascari aiDAPTIV™ 將模型與訓練狀態的可用容量擴充到 GPU 記憶體之外,有助於讓受記憶體限制的微調更具可行性。
在支援的訓練整合中,aiDAPTIV 可以透過 GPU 記憶體、系統記憶體與快取記憶體,暫存模型與訓練狀態,而無須將完整的工作集一次全部保留在 GPU 記憶體中。
確切處理方式因模型、執行階段、訓練方法、硬體配置、序列長度與批次大小而異。視工作負載而定,資料可能會被保留、在記憶體系統中移動,或是重新運算,在容量與執行時間之間取得平衡。
探索更大的候選模型或要求更高的微調配置,同時將資料保存在您控制的環境中。
參數高效微調仍然可能會遇到模型大小、序列長度
與批次配置方面的記憶體限制。
在不適合雲端訓練的情況下,將領域資料保留在本機。
Fine-tuning performance depends on the model, runtime, training method, hardware configuration, sequence length, batch size, and data movement through the memory tiers.
The value is added training capacity when GPU memory alone is the limiting factor.