AI之路 · 2026-06-10
Claude Fable 5 发布:任务越长,它越强——那人该站在哪?
Anthropic 昨夜推出首款面向大众的 Mythos 级模型。SWE-Bench 95%、能自主跑几天的长时程能力、能力与安全的双版本策略。对造物者来说,这意味着分工又变了。
昨晚(6 月 9 日),Anthropic 发布了 Claude Fable 5——他们第一款面向大众开放的 Mythos 级模型,比 Opus 系列还高一个能力层级。我今早把官方公告和几篇解析都过了一遍,有几个点值得记下来。
先说事实:这次发布强在哪
- 基准成绩:SWE-Bench Verified 干到 95.0%(Opus 4.8 是 88.6%),长时程 agentic 任务上官方的原话是——「任务越长、越复杂,领先优势越大」。
- 真实案例:5000 万行 Ruby 代码库,一天完成全库迁移,人工团队要两个月以上;还能自主运行数天不断线。
- 规格:默认 1M 上下文、128k 单次输出、自适应思考默认开启。
- 代价:API 价格约 Opus 的 2 倍(输入 $10 / 输出 $50 每百万 tokens),消费级订阅的配额消耗极快,早期用户已经在吐槽。
更有意思的是「双版本」策略
这次 Anthropic 没有简单地「发布一个更强的模型」,而是发了两个:
- Fable 5:同样的底层权重,加上实时安全分类器——网络攻击、生物化学高风险、模型蒸馏这几类请求会被拦下,回退到 Opus 4.8 并告知用户(触发率不到 5%);
- Mythos 5:去掉护栏的完整版,只给受信任的合作伙伴,先聚焦网络防御研究。
能力尽量广发,风险收口给可信方。 这是我见过的「能力 vs 安全」之间最认真的一次工程化取舍,而不是一句免责声明了事。
我的感受:分工又变了
三个月前我读 Anthropic 的 harness 文章,写过一篇手记:AI 工程像培训新员工——沟通、给资料、搭工位。当时的结论是「别再停留在聊得好,要开始搭得好」。
Fable 5 把这个结论推得更远了。当模型能自主跑几天,「干活」这一段人是彻底插不上手了——你不可能盯着它盯三天。那人的价值往哪挪?往两头挪:
- 开工前:任务怎么定义、标准怎么写、边界画在哪。它跑得越久,你开头那几行验收标准的杠杆就越大——写错一条,它会用三天时间认真地把错误做到极致。
- 收工后:它交回来的东西,好坏你得判得出来。判断力,是模型每强一代就升值一次的东西。
还有一个很实际的信号:2 倍的价格、飞快的配额消耗,意味着**「值不值得让它跑」本身成了一个需要判断的问题**。强模型不是拿来聊天的,是拿来投放到高杠杆任务上的——挑任务的眼光,也是人的活。
记在时间线上
2022 年那句「scary good」是门被推开;2025 年 Skills 让方法能沉淀;今年 3 月 harness 让环境能搭建;现在 Fable 5 让 agent 能独立当班好几天。
模型每往前一步,人的判断就更值钱一分。 这条时间线我会继续记下去——照例,在手记里。
想看珂的下一个作品?
关注珂