大模型RESEARCH BRIEF
Claude Fable / Mythos 5.1
同一底座,不同访问与防护边界
IN A NUTSHELL
Fable 5.1 与 Mythos 5.1 使用同一模型,但配置不同防护与访问条件;前者一般可用,后者受限。官方同时展示编程、科学任务等进展,评测结果需连同工具框架和任务版本阅读。
01
方法与关键变化
此次发布的重要设计是同一底座提供不同访问边界,而不是把两个名称理解成完全不同的网络架构。受限版本的科研或安全场景能力不能当作所有用户都可获得。
官方性能披露包含多个代理工作流;模型、工具框架、推理预算及数据版本共同影响最终成绩,单一数字不能脱离测试条件比较。
02
实验与证据
发布文注释指出部分科学任务的标准误约为 3.5–4.5 个百分点;OSWorld 2.0 使用 2026 年 8 月新任务文件,不能直接与旧版本分数比较。这些条件会影响“提升幅度”的判断。
03
开放情况与使用许可
Fable 一般可用,Mythos 受限;未开放权重。
LICENSE未公开模型许可证
04
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
同一基础能力在不同访问与防护条件下表现如何,是一个值得研究的部署问题。它能帮助区分模型潜在能力、允许执行的行为,以及产品实际交付的工作流。
反方 · 哪些结论还不够
受限版本成绩难以在日常产品里重现;不同评测版本、工具和操作环境也会改变结果。把家族中的最佳成绩合并成普通用户可获得的能力,会误导选型。
综合判断
先以自己有权访问的具体版本作判断。只有在固定环境下明显减少返工,能力升级才转化为实际收益。
我会先做的验证
固定真实仓库快照、任务说明和验收测试,记录各可访问版本的通过率、修改范围、人工修复时间和拒绝/中断情况;不对无法访问的版本编造对照。