20260901 信息来源: 钱 娥
编辑:白 思绍 | 责编:庄智杰【城主说】两天前Windsurf被Anthropic背刺了一次, 马上就要被禁其Claude模型API的调用,得益的显然就是竞争对手Cursor。且Cursor之前已经独享了Claude4.0的API调用,抛开商业竞争,从使用者角度,Windsurf的用户是很有可能迁徙到Cursor的。 回归到Cursor本身,这两天发布了正式版1.0。显然这是一个重大的里程碑,本次访谈是Cursor官方团队深入探讨了将强化学习(RL)应用于代码生成的复杂性与前沿进展。对话涵盖了编码领域强化学习的独特性、奖励机制设计的挑战、高级工具与长上下文窗口的作用、新型注意力架构与智能体记忆的实现,以及构建高效RL基础设施和未来发展方向等核心议题。团队一致认为,成功的关键在于结合高质量的真实世界反馈信号、高效的工具利用、更长的上下文理解能力以及能够摊销计算成本的智能体设计。(原文未见成员名字,且用ABCD指代) ? 未来的编码智能体将能够处理更长的输入和输出序列,并能通过代码库专业化来复用知识,实现更高效、更精准的代码生成与修改。 主持人: 对话的初始起点是强化学习(RL)。一个有趣的问题是,对编码进行强化学习与对其他更容易、更可验证的领域进行强化学习有什么不同?无论是数学,还是像写作或其他更有风险的领域。编码模型的不同之处是什么? 成员A: 嗯,其中一点是,编码的动作空间要大得多。所以如果爱游戏考虑数学,推理在数学方面效果很好,因为最终的答案非常简短。因此,推理有助于提供大量的行动以得出答案。而编码,某种程度上,推理已经包含在答案中,对吧? 成员B: 是的,而且为了得到答案,你必须调用多个工具。因此,它不是像生成推理token、生成答案、获得奖励这样,而是看起来像生成一些token、调用一些工具、从这些工具获得响应,并且你可能会迭代多次。所以强化学习(RL),强化学习的形式看起来有点不同,因为现在你必须经历这种多步骤的工具调用过程,并在此之上进行优化。 成员C: 对爱游戏来说,强化学习特别有趣,因为在收到模型完成结果后,爱游戏并不总是有办法确定它是否真正解决了用户的问题,或者做了用户想要的事情。你知道,如果你有一个带有标准答案的数学问题或者一个编码问题,那么你可以测试它是否得到了正确的答案。但爱游戏希望在用户并不总?