Tether AI 研究团队宣布开源 TurboQuant 生产版本,并将其集成至 QVAC SDK 0.12.0。TurboQuant 源自 Google Research 的内存压缩算法,可将 AI 运行时的 KV 缓存压缩最高 5 倍,同时保持接近未压缩模型的输出质量。这意味着笔记本电脑、手机及边缘设备在无需将数据上传至云端的情况下,可处理更长的对话、更大的文件及更复杂的任务。此次开源发布包含完整量化流水线、主流推理框架适配器及开发者文档,面向在消费级硬件、边缘设备及点对点网络上部署 AI 的开发者和初创团队。
Tether 开源 TurboQuant,本地 AI 设备 KV 缓存压缩比最高可达 5 倍
其他语言标题
- EnglishTether open-sources TurboQuant, achieving up to 5x compression ratio for KV cache in local AI devices.
- 한국어테더, TurboQuant 오픈소스 공개, 로컬 AI 장치 KV 캐시 압축률 최대 5배 향상