新闻
Anthropic 首次量化公开 AI 研发自动化进度:Claude 主导 26% 研发,压力甩给 OpenAI 等竞品 当地时间9月17日,Anthropic 发文,第一次以量化方式掀开了内部 AI 研发自动化的底牌
1 分钟阅读
Anthropic 首次量化公开 AI 研发自动化进度:Claude 主导 26% 研发,压力甩给 OpenAI 等竞品 当地时间9月17日,Anthropic 发文,第一次以量化方式掀开了内部 AI 研发自动化的底牌。数据相当扎眼:截至今年8月,Claude 已主导公司内部26% 的 AI 研发工作,而今年2月这一比例还不足1%;公司内部 Agent 平台任意时刻约有3万个 AI Agent 在跑,8月产生超过10亿次决策。这组数字被外界视为递归自我改进(RSI)从概念走向工程现实的关键信号。 Anthropic 采用了独立 AI 研究机构 Epoch AI 提出的六级自动化框架,把 AI 的参与程度划分为 AL0至 AL5——AL0完全没有 AI 参与,AL3是 AI 协作,AL4是 AI 主导,AL5为完全自主。截至8月,26% 的 AI 研发工作达到 AL4:人类只需给出高层目标,Claude 就能完成端到端的大部分工作,人只负责监督、检查和最终拍板;另有超过90% 的研发工作至少达到 AL3。 一个具体场景很能说明问题:夜间数据管道出故障后,工程师只需把报告丢给 Claude 说一句"把它修好",它就能自主查看日志、定位原因、编写修复代码、测试、处理新冒出来的问题,最后重跑管道、对比结果并撰写说明。但 Anthropic 也明确划了线——目前尚未有任何被测量的 AI 研发工作达到 AL5完全自主水平。 规模数据更为实在。截至8月,Anthropic 内部约3万个 Agent 从事研究和工程工作,它们拥有独立于底层模型升级的身份标识,通过共享消息系统互相委派任务、交叉纠错。安全监控上,所有 Agent 动作执行前都要过在线监控,8月超10亿次决策中约0.002% 被阻止;离线监控每周标记约10万条对话记录,经分类器过滤误报和初步审查后,最高优先级约50条升级到人工审查。算力分配方面,7月样本周内约6% 的 AI 研发算力投入安全研究,若只统计 AI 驱动的研发,这一比例升至约12%。Anthropic 也坦承,AI 协作与 AI 主导的边界存在主观性,跨实验室比