aiDAPTIV TM

更快的 AI 推理性能与更大规模的 LLM 训练,全程在本地部署(On-Prem)私有环境中完成

Pascari aiDAPTIV™ 工作原理 

How Pascari 
aiDAPTIV™ Works 

让活跃 AI 状态靠近计算资源 

系统中最快的内存应该存放模型当前需要的数据,而不是应用未来可能需要的所有 AI 状态。这通常包括模型组件、活跃 KV 缓存、活跃 MoE 专家、激活值,以及当前计算所需的其他数据。  

高速内存容量有限。 当模型权重、上下文和活跃应用状态争用该空间时,系统必须移除或重新计算数据,或将其移动到其他位置。  

aiDAPTIV= Middleware + Flash Memory

aiDAPTIV Middleware

Orchestrates AI data across GPU, DRAM, and flash memory.

aiDAPTIV Middleware

Orchestrates AI data across GPU, DRAM, and flash memory.

aiDAPTIV Cache Memory

Specialized high-speed, high-endurance SSD optimized for AI workloads.

Discrete-GPU system
Unified-memory system

aiDAPTIV 支持独立 GPU 和统一内存系统 

现代 AI 系统并不都采用独立的 GPU 显存和系统 DRAM。 

在独立 GPU 系统中,GPU 内存和系统内存属于两个独立的物理层。GPU 内存是高速层,而系统内存可作为中间层,为暂存数据或近期需要的数据提供存储空间。  

在统一内存系统中,CPU 和加速器共享一个物理内存池,该内存池作为高速层。在 Intel、AMD、NVIDIA 和 Apple 的生态中,客户端和服务器平台可能以不同形式实现上述架构。 

物理布局可能不同,但面临的限制相同:模型权重、活跃上下文和应用状态会争用计算资源附近最快的内存。 

在支持该功能的客户端、工作站、边缘设备和服务器配置中,aiDAPTIV Cache Memory 可为两类架构提供更大空间留存数据。它能让兼容的 AI 执行环境在更多内存位置保留符合条件的 AI 状态。活跃数据保留在可用的最快内存中,而较不活跃的状态可以留存在更大但更慢的内存层中,而无需马上丢弃或之后再重新生成。    

在兼容的集成训练环境中,aiDAPTIV 会在 GPU 内存、系统内存和缓存内存之间调度模型和训练状态,而不要求当前训练所需的全部数据始终留在 GPU 内存中。 

具体处理方式会因模型、运行时、训练方法、硬件配置、序列长度以及批次大小而变化。根据具体工作负载,数据可能会被保留、在内存系统中移动,或者在需要时重新生成,以平衡内存承载能力和执行时间。 

不同的 AI 数据需要不同的处理方式 

并非需要立即使用所有 AI 状态。 

可复用的 KV 缓存前缀可能具有较高价值,因为兼容的后续请求可以避免重复进行预填充处理。当前 Token 可能未调用某 MoE 专家,但之后几个 Token 可能会再次调用它。随着训练任务推进,微调状态可能需要在系统中的不同层之间移动。 

aiDAPTIV 会根据工作负载中 AI 数据不同的使用时机和复用特征进行处理,而不是将它们不加区分视为普通内存页。 

当高速层被占满时,系统有三种主要处理方式: 

1

丢弃数据 

2

之后重新生成

3

将其留在更大容量的层中

对于兼容的工作负载,aiDAPTIV 使第三种方式变得可行。它让当前需要处理的工作靠近计算资源,让符合条件的较不活跃状态留存在更大容量的层中,并在工作负载再次需要它时调回它。 

具体的数据放置位置会因模型、执行环境和任务而异。而贯穿的基本原则始终简单:将高速内存留给当前需要处理的工作,利用较低层级扩展容量、留存有价值的状态。 

容量是关键所在——也是权衡

从较低层移动数据需要时间。aiDAPTIV 并不会消除延迟,也不会让闪存等同于 GPU 内存。 

它的价值在于,让更大规模或需要更久保留状态的 AI 任务变得可行,避免不必要的重新计算,并让有限的高速内存专注于当前需要处理的工作。 

问题不在于缓存内存是否跟 GPU 内存一样快。真正应该问的是:对于您计划部署的系统,这种内存架构能否让目标 AI 任务变得可行。 

为什么这不是 swap 

Swap 将内存视为无差别的内存页。 

而 AI 状态并非可以一视同仁。可复用的 token 前缀、不活跃的 MoE 专家以及训练激活值,在价值和使用时机方面都有不同要求。 

aiDAPTIV 会管理这些差异,而不是简单地将字节移动到存储空间中。

运行时和平台适用范围 

具体能力会因运行时及版本、操作系统、GPU 或统一内存平台、模型架构、系统内存配置、缓存内存配置以及 AI 任务本身而有所差异。 

KV 缓存扩展和复用
动态 MoE
了解弹性微调

SEAMLESS INTEGRATION

  • Optimized middleware to extends GPU memory capacity
  • 2x 2TB aiDAPTIVCache to support 70B model
  • 低延迟

HIGH ENDURANCE

  • 业界领先,高达100次的五年内每日写入次数(DWPD)
  • 采用业界先进NAND 纠错算法的SLC NAND

aiDAPTIV+ BENEFITS

  • 即插即用,无缝集成
  • 无需修改现有 AI 应用
  • Reuse existing HW or add nodes

aiDAPTIV+ MIDDLEWARE

  • 模型自动分割与 GPU 资源调度
  • Hold pending slices on aiDAPTIVCache
  • Swap pending slices w/ finished slices on GPU

FOR SYSTEM INTEGRATORS

  • Access to ai100E SSD
  • Middleware library license

  • Full Phison support to bring up