【问题】长文本推理被「显存墙」卡住 在 32K 至 128K 超长上下文场景中,DeepSeek-V3.2-Exp 的 Decode 阶段需维护一个随序列长度线性增长的 Latent Cache。该 Cache 在 128K 下可占用数十 GB GPU 显存,迅速耗尽资源。
结果:
- Batch Size 无法扩大
- GPU 算力大量闲置
- 吞吐上不去,成本下不来
【策略】ESS 以「卸载 + 预取」 为核心:
- 将 Latent Cache 主体卸载到 CPU 内存
- 仅在 GPU 动态保留小而精的热点子集
- 在每步 Decode 前主动预取所需数据回 GPU
完全无损精度,打破 Batch Size 对 GPU 显存的依赖。
【方案】三层协同实现高效「卸载 + 预取」:
1. 高带宽传输,让数据「搬得快」🚀
挑战:Latent Cache 仅 656 字节、访问离散,传统拷贝带宽 <1 GB/s
方案:
- 基于 UVA,GPU 直访 CPU pinned memory
- 自研 FlashTrans 算子,聚合小请求、消除调度开销
效果:H2D/D2H 带宽达 37–43 GB/s 📈
2. 智能预取,让数据「搬得准」🎯
挑战:预取不准 → 无效搬运 → 性能反降
方案:
- 利用 Latent Cache 的强时间局部性
- GPU 用 LRU 管理 Sparse Memory Pool
- Prefill 阶段末尾 Top-K 条目预热缓存(LRU-Warmup)
效果:显著降低 Cache Miss
3. 计算通信重叠,让搬运「不挡路」🔄
挑战:Decode 计算量小,难掩传输延迟
方案:
- DA Overlap:用 Attention 前置计算掩盖 Latent Cache 预取延迟
- DBA Overlap:长上下文下沿 Batch 拆 Indexer,扩大重叠窗口
效果:数据搬运隐藏于计算流水线,关键路径无阻塞
【价值】吞吐显著提升 ✨
基于高精度模拟器测试结果,数据如下:
- 32K 上下文:吞吐提升 69.4%
- 128K 上下文:吞吐提升 123%
→ 显著降低长文本推理成本💰
更多详细内容,请阅读 ESS 技术报告全文:https://arxiv.org/abs/2512.10576。
提升超长上下文本推理吞吐,百度百舸 ESS 技术报告新鲜奉上
张小明
前端开发工程师
快速搞定数据 + 方案!市场经理速用Copilot Business,熬夜改稿退退退
市场经理的下午三点:刚啃完半块面包想赶 Q3 新品推广方案,领导甩来 5 页带交叉维度的营销数据报表,备注 “1 小时内要核心洞察”;同时明天客户要的方案框架还没搭 —— 谁没被这种 “数据堆成山 方案催到疯” 的局逼到薅头发&…
从零开始搭建STM32L0墨水屏卡片开发环境:新手避坑指南
从零开始搭建STM32L0墨水屏卡片开发环境:新手避坑指南 【免费下载链接】L-ink_Card Smart NFC & ink-Display Card 项目地址: https://gitcode.com/gh_mirrors/li/L-ink_Card 当你第一次接触STM32L0系列微控制器,想要实现一个集NFC和墨水屏显…
中英人寿携手思迈特软件,以智能问数打通保险经营分析关键链路
在保险行业数字化转型向纵深推进的关键阶段,企业数据丰富但业务应用不足成为制约其突破增长的共性瓶颈。作为中粮资本与英杰华集团合资组建的标杆险企,中英人寿规模与利润长期稳居合资寿险公司第一梯队。在 “数智中英” 战略蓝图指引下,其正…
自动驾驶—CARLA仿真(4)基础概念
基础概念 本页面介绍理解 CARLA 服务器与客户端如何通过 API 运行和通信所需的基本概念。 CARLA 采用客户端-服务器架构: CARLA 服务器负责运行仿真**客户端(一个或多个)**向服务器发送指令 客户端代码通过 API 与服务器通信。要使用 Pyt…
InstructPix2Pix终极指南:轻松掌握智能图像编辑
InstructPix2Pix终极指南:轻松掌握智能图像编辑 【免费下载链接】instruct-pix2pix 项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/instruct-pix2pix InstructPix2Pix是一款革命性的AI图像编辑工具,能够通过简单的文字指令来编辑图片…
嗨,机器人!与AI进行人性化互动的可能性
嗨,机器人!与AI进行人性化互动的可能性 在科技迅猛发展的今天,人工智能(AI)正以惊人的速度融入我们的日常生活。人们对AI的接受程度也在逐步提升,特别是在与机器进行互动的过程中,这种趋势尤为明…