
本站推荐电影
本站推荐电视剧
电影下载排行
电视剧下载排行

一 | 新智元报道
GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!
英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
去年同类内部测试中,这个差距是 6 到 10 个月。

二 | 这平息了有关他的竞选团队一直在考虑将黑利作为一个选项的传言。 今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。 开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。

三 |

四 | 这是他名下的上市公司的股票代码。 第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。

五 |

六 |

七 |

八 | 这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。可能她这几天过得很艰难,我会这么说的。

九 | 而防御工具的部署需要每个团队主动投入时间和成本。 AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。」 这组数据对 AGI 格局的影响比数字本身更深远。 开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。 闭源模型的护栏在 Fable 5 事件中被证明同样脆弱。 下一阶段对于全球的决策者而言,政策博弈的核心问题已经变得更尖锐:什么能力级别以上的模型不应开放权重。 AISI 宣布将继续评估 Kimi K3 等下一批开源模型——上面这条线画在哪里,很可能取决于接下来几个月的测试结果。

十 | 参考资料: https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md https://www.patreon.com/MasBandwidth/posts/important-news-164199395 编辑:马可。
Current article:http://xfyy.jiubengtaibingpengou.pics/55xpo/m33l.html
Published on:12:22:13