2026-06-25 12:47 天天模拟器
6 月 10 日消息,Anthropic 于 6 月 5 日发布博文指出,人工智能(AI)已经开始加速自身的研发进程,正逐步迈入递归自我改进的阶段。
注:递归自我改进是指 AI 系统能够自主设计、训练、评估并迭代更新自己的下一代版本,形成“自己改进自己”的闭环循环。
这一概念被视为 AI 发展中的一个关键分水岭,一旦闭环建立,技术进步的速度可能主要取决于算力、基础设施与验证机制,而不再受限于人工研发的节奏。
该博文强调,这一阶段尚未完全到来,也并非必然发生,但相关信号已经比大多数机构的准备更早、更强烈。
首先是能力的加速提升。Anthropic 引用公开基准指出,AI 能够稳定独立完成任务的时长大约每四个月翻倍:
2024 年 3 月,Claude Opus 3 可完成约 4 分钟的软件任务;
2025 年 3 月,Claude Sonnet 3.7 可处理约 1.5 小时的任务;
2026 年 3 月,Claude Opus 4.6 已能处理 12 小时的任务。
在公开基准测试中,模型的进步速度也很快。SWE-bench 用于衡量真实软件工程修复能力,模型在两年内从个位数的成绩逼近饱和。
CORE-Bench 用于测试复现实验论文结果的能力,AI 在 2024 年约为 20% 的成功率,在 15 个月后已接近饱和。METR 还发现,Claude Mythos Preview 的连续工作时长至少达到 16 小时,已接近现有任务集可测的上限。
在 Anthropic 内部,截至 2026 年 5 月,超过 80% 的合入代码由 Claude 编写;而在 Claude Code 于 2025 年 2 月进入研究预览阶段前,这一比例还是个位数。
随着模型从代码建议转向自主运行与长时任务处理,工程师人均日合入代码量显著提升,2026 年第二季度典型工程师的产出是 2024 年的 8 倍。不过文中也提醒,代码行数更侧重数量,不能等同于真实生产率。
除代码产出外,Claude 在执行复杂任务方面的效果也更强。Anthropic 员工在 2026 年 3 月的一项覆盖 130 人的调查显示,受访者估计在 Mythos Preview 的帮助下,产出中位数约为无 AI 时的 4 倍。
2026 年 4 月,Claude 还完成了超过 800项修复,将一类 API 错误降低到原来的 1/1000,负责监督的工程师估计,若完全依靠人工可能需要 4 年时间。
Anthropic 的文章反复强调,当前人类的优势仍集中在研究判断、问题选择、结果信任与方向把控上。目前 AI 在“执行”方面接近甚至超越人类,但在“决定做什么”方面仍有差距。
Anthropic 还透露,AI 的自我改进并不会凭空爆发,它仍受算力约束。即使 Claude 能编写更多代码,企业若想将这种闭环推向更高强度,仍然需要更大规模的计算资源。
来源:IT之家
