UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 ARCHIVE A-136
ARCHIVE ACCESS · A-136 · CLEARANCE LV.4⇱ 在时间树中定位
正史 · 官方档案 军备 ⌖ DEVIN 战区

SWE-2:Kimi K3 底座,省 64%

Cognition 发布 SWE-2:在月之暗面 2.8 万亿参数的开源模型 Kimi K3 上再做强化学习,FrontierCode 1.1 Main 50.0%,距 Fable 5.1 一分,成本低 64%。不放权重、无 API,只在 Devin 内可用。

9 月 10 日,Cognition 发布 SWE-2,称其「迄今最先进的编码模型」。底座公开写在博客第四段:Kimi K3,月之暗面 7 月开源的 2.8 万亿参数 MoE 模型,本已经过大量面向 agent 编码的强化学习;Cognition 在其上再做 RL,宣称「仍找到可观的余量」,多项基准加 5 到 6 分。这是该公司第二次在 Moonshot 底座上造模型——7 月的 SWE-1.7 来自 Kimi K2.7。

自报成绩表(对照数字取公开结果,或在各家原生 harness 下自测):FrontierCode 1.1 Main 50.0%,Kimi K3 44.2%,Grok 4.6 48.0%,Fable 5.1 50.9%,GPT-5.6 Sol 47.5%,GPT-6 Astra 53.3%;DeepSWE 1.1 73.0%;Terminal-Bench 2.1 92.8%,表内最高;Terminal-Bench 4 则是 27.3%,Fable 5.1 为 55.8%、Astra 57.9%——同一张表,只有前一行进了标题。成本口径是按各家标价算的每任务成本:SWE-2 的 medium 档比 SWE-1.7 少 58% 轮次、便宜 81%。技术贡献是一种按帕累托切线定的成本惩罚,让三档算力在同一次 RL 中一起训出。

分发方式决定了它的位置:不发权重、不开按 token 计价的 API,只在 Devin Desktop 与 CLI 上线,Web 与 Fusion 随后。一家美国公司拿中国的开源底座后训练出近前沿编码模型,并在同一篇博客里附上自家的「可信度」评测——宣传与声明并置,六个模型同列。今年春天,Cursor 的自研模型被场外溯源到 Kimi 底座;这一次,底座写在了第一页。

◈ 事件线索 · 模型军备(19 个节点)
2026.09.10SWE-2:Kimi K3 底座,省 64%(本条)
◷ 窗口跨度 813 天(2024.06.20 → 2026.09.11)· 线索专页 »
◐ 同日另一线 · 双线对照
野史发布日采样:六倍 PR,没有样本量
◈ 同类档案 · 军备
正史Astra 进 Copilot 全线,Cursor 无正史Astra 定级 Critical:先设卡再发布
UMBRELLA 4365 ARCHIVE · 正史档案 · 仅作记录 · 不构成立场
⇱ 返回完整时间树 UMBRELLA 4365 · 正史 82 条 × 野史 55 条 · 双线对照阅读