AI自我生成的技能毫无意义 — 颠覆LLM自我改进神话的实证研究
SkillsBench实证研究表明AI代理的技能自动生成实际上毫无帮助。在7,308条轨迹中,自我生成技能的效果为零,而人工策划技能提升了16.2个百分点。
标签
3篇文章
SkillsBench实证研究表明AI代理的技能自动生成实际上毫无帮助。在7,308条轨迹中,自我生成技能的效果为零,而人工策划技能提升了16.2个百分点。
在标准基准测试中名列前茅的Qwen 3.5,在自动售货机经营模拟Vending-Bench 2中破产。探讨基准测试偏重带来的AI评估盲区。
MiniMax M2.5在SWE-Bench Verified上达到80.2%,超越Claude Opus 4.6。我们通过全面的基准测试数据,分析开源权重模型与闭源模型之间性能差距快速缩小的现状。