微调任务可能会在用尽算力前,就先耗尽内存。
训练任务不只需要内存来保存模型权重,还需要它来保存梯度、优化器状态、激活值、中间数据、输入序列以及批次数据。
增加模型规模、序列长度或批次大小后,高速内存可能会在系统用尽算力前就先被耗尽。
Pascari aiDAPTIV™ 通过扩展 GPU 内存之外的可用空间,来保存模型和训练状态,帮助受内存限制的微调得以实现。
在兼容的集成训练环境中,aiDAPTIV 会在 GPU 内存、系统内存和缓存内存之间调度模型和训练状态,而不要求当前训练所需的全部数据始终留在 GPU 内存中。
具体处理方式会因模型、运行时、训练方法、硬件配置、序列长度以及批次大小而变化。根据具体工作负载,数据可能会被保留、在内存系统中移动,或者在需要时重新生成,以平衡内存承载能力和执行时间。
您可以在自己掌控的数据环境中,尝试更大规模的模型和更高负载的微调配置。
即使采用参数高效微调,若模型规模较大、序列较长、
批次配置较高,内存仍可能不足。
当不适合采用云端训练时,让领域数据保留在本地环境中。
Fine-tuning performance depends on the model, runtime, training method, hardware configuration, sequence length, batch size, and data movement through the memory tiers.
The value is added training capacity when GPU memory alone is the limiting factor.