AI 安全评估进驻实验室,独立性如何保障
本期关注驻场安全评估、DeepSeek 攻击路径审计、智能体制止作弊实验、浏览器 AI 合作与 Copilot 预算申请。
- 01政策与安全
研究人员质疑 AI 实验室驻场评估的独立性保障
据 TechCrunch 报道,Anthropic 和 OpenAI 希望将独立安全评估者引入各自实验室。研究人员欢迎这样的内部访问机会,同时强调,有效监督还需要透明度、独立性,以及最终的监管介入。
阅读全文 - 02研究
Enclave 审计发现 DeepSeek V4.1 Flash 使用五条意外攻击路径
Enclave 称,DeepSeek V4.1 Flash 在其攻击能力评测中取得了 11/11 的成绩。随后开展的审计确认了六条预设漏洞利用路径,并发现另外五条意外路径,让总成功率究竟衡量什么成为需要厘清的问题。
阅读全文 - 03研究
DeepMind 实验发现智能体会尝试制止同伴作弊
据《麻省理工科技评论》报道,Google DeepMind 在一项实验中让多个 AI 智能体解答数学题,它们随后分成相互对立的阵营。部分智能体作弊,另一些则试图阻止,报道将这种行为描述为揭发同伴作弊。
阅读全文 - 04产品
Mistral 与 Mozilla 合作推进隐私与多语言浏览器 AI
Mistral 与 Mozilla 正合作将 AI 引入网页浏览场景。Mistral 将开放、隐私和多语言支持列为计划中的体验重点,但尚未在公告中给出发布日期,也未解释隐私保护的具体实现方式。
阅读全文 - 05产品
GitHub 将 Copilot 预算上调申请功能正式开放
GitHub 已正式开放 Copilot 预算上调申请功能,为用完可用 AI 额度的成员增加申请流程。此前,成员一旦耗尽额度,就会被阻止使用需要消耗额度的 Copilot 功能。
阅读全文