系统中最快的内存应该存放模型当前需要的数据,而不是应用未来可能需要的所有 AI 状态。这通常包括模型组件、活跃 KV 缓存、活跃 MoE 专家、激活值,以及当前计算所需的其他数据。
高速内存容量有限。 当模型权重、上下文和活跃应用状态争用该空间时,系统必须移除或重新计算数据,或将其移动到其他位置。
Orchestrates AI data across GPU, DRAM, and flash memory.
Orchestrates AI data across GPU, DRAM, and flash memory.

Specialized high-speed, high-endurance SSD optimized for AI workloads.
现代 AI 系统并不都采用独立的 GPU 显存和系统 DRAM。
在独立 GPU 系统中,GPU 内存和系统内存属于两个独立的物理层。GPU 内存是高速层,而系统内存可作为中间层,为暂存数据或近期需要的数据提供存储空间。
在统一内存系统中,CPU 和加速器共享一个物理内存池,该内存池作为高速层。在 Intel、AMD、NVIDIA 和 Apple 的生态中,客户端和服务器平台可能以不同形式实现上述架构。
物理布局可能不同,但面临的限制相同:模型权重、活跃上下文和应用状态会争用计算资源附近最快的内存。
在支持该功能的客户端、工作站、边缘设备和服务器配置中,aiDAPTIV Cache Memory 可为两类架构提供更大空间留存数据。它能让兼容的 AI 执行环境在更多内存位置保留符合条件的 AI 状态。活跃数据保留在可用的最快内存中,而较不活跃的状态可以留存在更大但更慢的内存层中,而无需马上丢弃或之后再重新生成。
在兼容的集成训练环境中,aiDAPTIV 会在 GPU 内存、系统内存和缓存内存之间调度模型和训练状态,而不要求当前训练所需的全部数据始终留在 GPU 内存中。
具体处理方式会因模型、运行时、训练方法、硬件配置、序列长度以及批次大小而变化。根据具体工作负载,数据可能会被保留、在内存系统中移动,或者在需要时重新生成,以平衡内存承载能力和执行时间。
并非需要立即使用所有 AI 状态。
可复用的 KV 缓存前缀可能具有较高价值,因为兼容的后续请求可以避免重复进行预填充处理。当前 Token 可能未调用某 MoE 专家,但之后几个 Token 可能会再次调用它。随着训练任务推进,微调状态可能需要在系统中的不同层之间移动。
aiDAPTIV 会根据工作负载中 AI 数据不同的使用时机和复用特征进行处理,而不是将它们不加区分视为普通内存页。
对于兼容的工作负载,aiDAPTIV 使第三种方式变得可行。它让当前需要处理的工作靠近计算资源,让符合条件的较不活跃状态留存在更大容量的层中,并在工作负载再次需要它时调回它。
具体的数据放置位置会因模型、执行环境和任务而异。而贯穿的基本原则始终简单:将高速内存留给当前需要处理的工作,利用较低层级扩展容量、留存有价值的状态。
从较低层移动数据需要时间。aiDAPTIV 并不会消除延迟,也不会让闪存等同于 GPU 内存。
它的价值在于,让更大规模或需要更久保留状态的 AI 任务变得可行,避免不必要的重新计算,并让有限的高速内存专注于当前需要处理的工作。
问题不在于缓存内存是否跟 GPU 内存一样快。真正应该问的是:对于您计划部署的系统,这种内存架构能否让目标 AI 任务变得可行。
Swap 将内存视为无差别的内存页。
而 AI 状态并非可以一视同仁。可复用的 token 前缀、不活跃的 MoE 专家以及训练激活值,在价值和使用时机方面都有不同要求。
aiDAPTIV 会管理这些差异,而不是简单地将字节移动到存储空间中。
具体能力会因运行时及版本、操作系统、GPU 或统一内存平台、模型架构、系统内存配置、缓存内存配置以及 AI 任务本身而有所差异。