Claude Mythos 发现 2.3 万条漏洞线索,超 2.1 万条无人复核
BestBlog编程类文章 · 软件开发
📌 一句话摘要 Anthropic 将 Claude Mythos 应用于 281 个开源项目的漏洞扫描发现 2.3 万个候选漏洞,但 91% 未经外部审核;严重性评级存在系统性高估,利用能力较前代跃升约 90 倍,但仍受限于审核资源不足。 📝 详细摘要 Anthropic 用 Claude Mythos Preview 扫描 281 个开源项目,收集到 23,019 个候选漏洞,仅 1,900 个获得外部安全公司审核,其余 21,119 个无人复核。已审核样本中 90.8% 被确认为真实漏洞,但 Echo 指出该样本可能并非随机抽取,未必代表整体准确率。严重性评级方面,88 份安全公告中 Mythos 评出 8 个 Critical,而独立 CVSS 评分仅有 1 个成立;两个降级案例显示模型无法感知利用前提条件和权限边界等上下文信息。在漏洞利用基准测试中,Claude Mythos Preview 对 Firefox SpiderMonkey 引擎 50 个已知漏洞的成功转化率达 72.4%,较 Claude Opus 4.6 的不到 1% 提升约 90 倍,但该测试使用了剥离沙箱的保护框架,且由 Anthropic 自行设计执行。Echo 调查显示 37% 的安全负责人将「检测到漏洞超过修复能力」视为供应链安全最大障碍,Anthropic 也因审核人手不足暂停向维护者发送更多报告。 💡 主要观点 漏洞发现量大但审核资源严重不足 23,019 个候选漏洞中仅 1,900 个获外部审核,91% 无人复核;Echo 指出送审样本可能存在选择偏差,90.8% 的确认率未必反映全量准确率。 严重性评级存在系统性高估 8 个 Critical 评级中仅 1 个成立,14 个漏洞中存在 13 个高估案例;模型无法感知利用前置条件(如特权凭据、集群 root JWT),仅凭源代码难以判断影响范围。 漏洞利用能力跃升显著但评估条件受限 Claude Mythos Preview 在 Firefox 漏洞利用基准中成功率达 72.4%,较 Opus 4.6 提升约 90 倍;但测试框架剥离了浏览器沙箱和纵深防御保护,且由 Anthropic 自行设计执行,尚未经独立复现。 检测能力超越修复能力成为行业共识障碍 Echo 调查显示 37% 的美国高级安全负责人将「检测到的漏洞数量超过修复能力」列为供应链安全最大障碍;Anthropic 也因内部团队和合作伙伴缺乏审核能力而暂停发送更多报告。 💬 文章金句 23,019 个候选漏洞,外部安全公司审核了其中 1,900 个,其余 21,119 个未经 Anthropic 以外的任何人审核。 8 个 Critical 评级中仅有 1 个成立。 严重性取决于部署假设、权限边界和攻击前置条件,而这些很难仅凭源代码判断。 Claude Mythos Preview 在 181 次试验中(即 72.4%)将一个已知崩溃转化为可用的任意代码执行漏洞,而 Claude Opus 4.6 仅成功 2 次,成功率不足 1%。 37% 将"检测到的漏洞数量超过修复能力"列为改善软件供应链安全的最大障碍。 📊 文章信息 AI 初评: 82 来源: FreeBuf 作者: FreeBuf 分类: 人工智能 语言: 中文 阅读时间: 6 分钟 字数: 1359 标签: AI安全事件 , 漏洞扫描 , Claude , Anthropic , 供应链安全 阅读完整文章