Tab 改用在线强化学习
官方博客披露:补全模型 Tab 改为在线强化学习持续训练,以日均超 4 亿次请求的采纳与拒绝为信号——建议量减少 21%,采纳率提升 28%,新模型一天上线多次。自研路线的第一块试验田不是对话,是补全。
9 月 12 日,Cursor 发布技术博客《Improving Cursor Tab with online RL》:Tab 跑在每一次击键与光标移动上,日均处理超 4 亿次请求;新训法把「要不要出建议」直接并入模型策略——奖励设计为采纳记 +0.75、拒收记 −0.25、沉默记 0,数学含义是估计采纳率超过 25% 才开口。上线结果一降一升:建议展示量减少 21%,采纳率提升 28%。
工程侧真正激进的是节奏:部署、采集在轨数据、重训的完整循环压缩到一两个小时,新 checkpoint 一天上线多次——模型上午还在从用户的接受与拒绝里学习,下午已经换上新的自己。一位 OpenAI 后训练工程师的评价被业内反复引用:这是「实时强化学习优势的首次大规模演示」。
放进时间线,这一步的分量大于一次模型升级:补全是 2024 年 11 月收购 Supermaven 买来的招牌;在这块最高频、最低风险的试验田上跑通强化学习,随后它在 Composer 上放大成正式的自研路线。先练手,再押主力——自研的路径图,这一天已经画好。
◈ 事件线索 · 自研模型线(7 个节点)
2025.09.12Tab 改用在线强化学习(本条)
2025.10.29Cursor 2.0:自研 Composer 亮相 »
2026.03.19Composer 2:首次持续预训练 »
2026.03.20溯源完成:底座 kimi-k2p5 »
2026.05.18Composer 2.5:便宜一个量级 »
2026.07.08训练数据混入:自家代码 »
2026.07.20泄露信号:代号 Vega »
◷ 窗口跨度 311 天(2025.09.12 → 2026.07.20)· 线索专页 »
◐ 同日另一线 · 双线对照
野史编码数据探价:买家含 OpenAI
◈ 同类档案 · 进化
正史云端 Agent 配上专属虚拟机正史0.43:Composer 里长出 Agent
信源 SOURCE · https://cursor.com/blog/tab-rl
UMBRELLA 4365 ARCHIVE · 正史档案 · 仅作记录 · 不构成立场