一个正在被改写的规则
过去一年,”长上下文”是 AI 领域最热门的关键词之一。但如果问从业者一个最现实的问题:“你们真的在用全量上下文做 RL 后训练吗?”
大多数人的答案是:“不,因为显存不够。”
直到本周,Together AI 的一篇论文和 Databricks 的开源工具同时指向一个可能改变格局的数字:87%。
突破的实质:87% 内存削减
Together AI 的 Context Parallelism + Head Chunking
Together AI 发布的新训练方法,核心组合是:
- Context Parallelism:将长序列分割到多个 GPU
- Sequence Parallel-style Head Chunking:对注意力头进行分块处理
在 8×H100 单节点上训练 5M context window 8B 模型时,注意力内存削减达到 87%。
这个数字意味着什么?我们来算一笔账:
| 配置 | 传统方法(估计) | Together 方法 | 削减幅度 |
|---|---|---|---|
| 注意力内存 | ~160 GB | ~21 GB | 87% |
| 总显存需求 | >200 GB | ~80 GB | 60%+ |
| 可行硬件 | 8×H100(需优化) | 8×H100(常规) | - |
简单说:过去需要专业级分布式训练的长上下文训练,现在一个标准服务器节点就可能跑得动。
Databricks FlashOptim 的”双降”
同一天,Databricks 开源 FlashOptim——一组针对 AdamW/SGD/Lion 的内存优化实现。
核心数据:
| 指标 | 传统 AdamW | FlashOptim | 削减 |
|---|---|---|---|
| 每参数显存 | 16 bytes | 7 bytes | 56% |
| 含 gradient checkpoint | 16 bytes | 5 bytes | 69% |
| 8B Finetune 峰值 | 175 GiB | 113 GiB | 35% |
结合起来看:一个 8B 模型的 100K 上下文微调,在消费级 8 卡 GPU 机器上从”不可能”变成”勉强可行”。
为什么这很重要:三个维度
1. RL 后训练的”全上下文”噩梦
当前大模型的后训练(RLHF、DPO 等)有一个公开的秘密:
- SFT 阶段可以用长上下文(因为是简单的 next-token prediction)
- RL 阶段几乎全部在短上下文上进行(因为 PPO 的 actor-critic 架构在显存上极其昂贵)
这导致一个荒谬的现实:模型最终能在 100K 上下文中工作,但它的”偏好学习”只在 4K 以内完成。
87% 的内存削减意味着什么?RL 阶段首次有可能用全量上下文训练,从而真正让模型的”推理能力”和”偏好”在完整上下文空间中形成。
2. 边缘部署的连锁反应
长上下文训练的成本下降,不会止步于研究——它会向产业链下游传导:
- 微调成本下降 → 更多小团队能自己做后训练
- 训练效率提升 → 更快迭代 → 更多实验 → 更快收敛
- 消费级硬件可行性 → AI Native 应用不再依赖云端
一个可能的情景:2026 年底,一台配备 8 张 H100 的工作站可以完成一个 8B 模型的全量 128K 上下文后训练,耗时从数周缩短到数天。
3. “上下文长度”从技术壁垒变为工程问题
过去一年,上下文长度的竞争是”军备竞赛”——只有资金最雄厚的实验室才能烧出 1M、2M 的上下文。
当训练成本不再是壁垒时,上下文长度的竞争将从”谁能烧更多钱”转向”谁能更好地利用上下文”。
这意味着:
- 评估标准将从”最长上下文”变为”最长上下文 + 有效利用率”
- 应用层将出现更多”上下文工程”(如何设计 prompt、结构化信息)而非”模型工程”
- 注意力机制本身的效率改进将变得更为关键
技术细节:为什么能削减这么多
注意力内存的瓶颈
标准 Transformer 的注意力机制在处理长序列时,显存占用是 O(N²) 的复杂度——序列长度翻 4 倍,显存需求翻 16 倍。
传统优化手段:
- FlashAttention:将 O(N²) 变为 O(N),但仍有中间结果显存开销
- Gradient Checkpointing:用时间换空间,但影响训练速度
- 模型并行:增加通信开销,复杂
Together 方法的创新点
-
Context Parallelism:不把所有序列放在一个 GPU 上,而是分散到多个 GPU,每个 GPU 只处理序列的一部分
-
Head Chunking:将注意力头分组处理,进一步减少单次计算需要的显存
-
两者的协同:传统方法各自为战,Together 将它们作为统一架构设计,实现了”1+1>2”的效果
这本质上是一种分布式计算 + 内存优化的联合优化,不是单一技术的突破。
局限性和未解决问题
还没到达”消费级”
87% 是特定配置下的数字:
- 8B 模型
- 8×H100
- 5M 上下文
换成 70B 模型,或者更长的上下文,显存需求仍然严峻。当前的突破是重要的一步,但不是终点。
训练速度的代价
内存削减往往伴随着计算效率的损失。87% 的内存削减对应多少训练时间增加?目前缺乏公开数据。这需要进一步验证。
框架集成
Together 的方法目前需要特定的框架支持,与 PyTorch FSDP、DeepSpeed 的集成尚未完全。工程落地的门槛仍然存在。
产业影响预测
短期(3-6 个月)
- 主要云服务商会快速跟进类似优化,长上下文训练的价格将大幅下降
- 研究论文会加速产出,因为”跑不起实验”的瓶颈被打破
- 创业公司开始尝试”全量上下文 RL”,但效果需要时间验证
中期(6-12 个月)
- 128K 上下文训练从”前沿”变为”常规操作”
- 出现新的”上下文工程”岗位和工具链
- 评估基准会加入”长上下文下的 RL 效果”作为新维度
长期(1-2 年)
- 如果 1M 上下文训练也进入”可行”区间,AI Agent 的记忆能力将获得质的飞跃
- 边缘设备(消费级 GPU)运行长上下文模型将成为可能,端侧 AI 迎来新机会
结论
87% 是一个让人兴奋的数字,但更重要的是它背后的信号:长上下文训练的”成本墙”正在被突破。
过去三年,我们见证了推理成本的两个数量级下降(从 2020 年的 $60/M 降至 2026 年的 $0.25/M)。如果训练成本也走上类似的下降曲线,AI 能力的迭代速度将进入一个新的数量级。
2026 年可能是”长上下文从研究走向产品”的转折之年。
下期预告:当我们能训练长上下文模型后,如何评估”长上下文下的推理质量”?现有的 benchmark 是否仍然有效?