AI+ 2026-09-23

Ember-1:让推理模型「戒掉想太多」的新路线

2026 年 9 月 23 日,推理云平台 Fireworks AI 发布研究预览版模型 Ember-1——基于开源模型 Kimi K3 训练的「专业化模型」,核心主张只有一句话:最省成本的做法不是让模型少思考,而是让它学会高效思考。上线后冲上 Hacker News 首页(330+ 分)。

问题:推理模型的「思维内耗」

Fireworks 的数据显示,Kimi K3 这类推理模型超过 90% 的生成 token 花在内部推理上,而非最终答案;在多轮 Agent 任务中,上下文长度还会随轮次近似二次增长。用户花的钱,大部分买的是「模型的思考过程」。业界通行解法是调低推理力度(reasoning effort)——但那是「少想」,质量随之下降。

Ember-1 的答案:训练模型精简思考

Ember-1 通过 50+ 次训练实验、200+ 次评估(全部在 Fireworks 自家 Serverless Training 平台完成),让模型学会用约 40% 更少的 token 达到 K3 的答案质量。基准对比(vs K3-max):

  • Terminal Bench 2.1:82.0%(K3-max 80.9%),成本降 51.9%——分数反超且价格腰斩;
  • DeepSWE 1.1:75.2%(vs 66.4%),成本降 23.7%;
  • SWE-bench Verified:92.2%(vs 93.2%),成本降 15.5%;
  • 客户 A/B 测试:每任务约省 35% token,质量相当,内部开发者「几乎无感知切换」。

路线之争:降价、压缩,还是「学会少想」?

本周行业的主旋律恰好构成三重奏:OpenAI 靠降价 50%、Anthropic 靠自适应推理分档、Fireworks 靠训练专门化模型——三家从不同方向回答同一个问题:推理 token 的成本曲线怎么压。Ember-1 的思路有个独特的优雅之处:它不依赖厂商降价(用户无法控制),也不依赖用户调参(需要在质量与成本间取舍),而是把效率固化进模型本身。若该路线被验证,可以预期各大开源模型社区会快速跟进「精简推理」的变体训练——毕竟基座是开放的 Kimi K3。

对企业的启示

  1. 1Agent 场景收益最大:多轮 Agent 任务是「思维内耗」的重灾区,token 二次膨胀直接决定账单。批量 Agent 工作流的企业值得把 Ember-1 这类精简模型纳入对比测试;
  2. 2两周窗口:Ember-1 以 Research Preview 形式提供两周 Serverless 免费访问(视社区反馈转永久),是低成本实测的好机会;
  3. 3与本周 DeepSeek DSec 论文呼应——推理成本的战场已从「芯片算力」深入到「每一次思考的质量」。ProMen 为企业做多模型选型时,以真实任务的成本-质量曲线为准绳,欢迎与我们交流评测方案。

继续阅读