TAG:SWE-Bench

快手KwaiKAT发布KAT-Coder-Pro V2.5:告别“补代码”,首个端到端跑通完整工程的国产Agentic编程模型

快手KwaiKAT发布KAT-Coder-Pro V2.5:告别“补代码”,首个端到端跑通完整工程的国产Agentic编程模型

快手KwaiKAT发布KAT-Coder-Pro V2.5,首个能端到端跑通完整工程的国产Agentic编程模型。针对传统模型“跑分高落地差”痛点,在长程工程(AutoBuilder构建成功率57.2%)、通用Agentic能力和大规模强化学习(非对称PPO、MOPD蒸馏)三大维度升级,实现独立完成软件工程与复杂工作流。SWE-Bench Pro达65.2,已上线StreamLake平台开放API。

2026-07-10 17:43
570
0

OpenAI质疑AI评测标杆失灵:731道题近三成有缺陷,8个月通过率从23%升至80%

OpenAI质疑AI评测标杆失灵:731道题近三成有缺陷,8个月通过率从23%升至80%

OpenAI发布博文猛烈炮轰AI软件工程权威基准SWE-Bench Pro。在731个公开任务中约30%存在评测缺陷,包括测试过严、提示不充分、隐藏要求与题面不一致等问题。这直接导致前沿模型通过率在8个月内从23.3%异常飙升至80.3%。OpenAI通过数据分析和人工审查交叉验证后,正式撤回采用建议,并呼吁由资深软件开发者专门为AI设计新的基准,促使行业从跑分竞赛回归真实工程能力评估。

2026-07-09 17:01
32
0

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 A³·爱力方

https://www.agentren.cn/