现代 AI 往往会在算力耗尽前,先遭遇内存容量瓶颈。
Pascari aiDAPTIV™ 是 Phison 专为 AI 系统打造的解决方案,适用于从客户端电脑、工作站,到边缘部署环境和服务器等多种应用。该方案结合 aiDAPTIV 中间件和 aiDAPTIV 缓存内存,通过整合 GPU 内存、系统内存和基于闪存的专用存储层,扩展可用 AI 内存。
运行更大模型。保留更多上下文
一个模型可能在加载阶段运行正常,但真正开始执行任务时出现问题。当加入长文档、RAG 资料、工具定义(Tool Definitions)、智能体状态或更大的 MoE(混合专家)模型时,同一套系统可能会耗尽内存。
aiDAPTIV 受支持的运行时环境,将活跃的 AI 状态保持在靠近计算资源的位置,不太活跃的状态保存到更大容量的内存层并在需要时将其调回。
aiDAPTIV 缓存内存是基于闪存的专用存储层,用于存放无法永久保留在高速内存中的 AI 状态,以避免其挤占更紧迫的工作所需的空间。
GPU 内存或统一内存
即时计算
活跃模型状态,活跃 KV 缓存,活跃专家,当前训练层
系统内存
Staging and expanded capacity on discrete-GPU systems
Prefetched data, intermediate cache, state likely to be needed soon
aiDAPTIV 缓存内存
保留容量
不太活跃的 KV 缓存、较少使用的专家、暂存模型或训练数据
长提示词、RAG 或重复使用的文档会使首 Token 延迟变得难以忍受
稀疏 MoE 模型所需空间超过可用内存
微调因内存不足而失败
我的模型或总上下文超出了可用空间,但我不确定是哪项内存限制导致了问题
查看 Newegg 上搭载 aiDAPTIV 配置的 ABS 系统。