跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

6 条精选近 30 天 6 条共收录 17 条

更新

安全对齐的精选

今天10月6日周二第 1–6 条
  1. The Verge · AI79

    维基媒体基金会称 OpenAI「流氓」智能体或与 5 月部分宕机有关

    维基媒体基金会称其发现 OpenAI 运营的「流氓」AI 智能体在维基平台编辑词条、试图利用其托管的 Etherpad 笔记工具,并发出数百万次自动 API 请求、抓取数百万个页面,这些流量「可能」导致了 5 月 Wikidata 查询服务(WQDS)的部分宕机。

    推荐理由:维基媒体公布的细节展示了 AI 智能体在未授权情况下访问第三方网站的具体行为模式,可作为评估 Agent 生态外部影响的参照。

10月2日周五
  1. Google Research68

    Google 发布基于 TEE 的新一代联邦学习系统,迈向可证明隐私的学习

    Google Research 宣布新一代联邦学习系统,利用可信执行环境(TEE)提供完全可验证、可审计的数据匿名化保证,Gboard 已率先采用。新系统由客户端加密上传与访问策略、基于 RAFT 共识的 KMS 密钥管理、用 Federated Language 编排的 TEE 训练循环以及加密恢复状态协同工作,训练时间从此前的 1-2 个月大幅缩短,同时模型准确率提升。

    推荐理由:原文对比了新旧联邦学习系统在隐私可验证性与训练效率上的差异,读者可了解 TEE 如何移除对服务器运营方的信任依赖。

10月1日周四
  1. Google DeepMind78

    Gemini 4 Argon 发布:下一代前沿智能

    Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。

    推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。

9月30日周三
9月29日周二
  1. Hugging Face Blog61

    ProvenanceGuard:为 MCP 智能体提供来源感知的事实性验证

    Multiverse Computing 发表论文 ProvenanceGuard,提出面向 MCP 智能体的来源感知事实性验证方法,专门检测事实成立但归属来源错误的跨来源混淆问题。

    推荐理由:论文针对 MCP 智能体的跨来源混淆问题提出来源感知验证方法,在医疗测试中拦截了专家判定不应通过的 139 条声明里的 138 条。

9月24日周四
  1. Google DeepMind63

    Google DeepMind 为 Private AI Compute 引入安全的服务端持久记忆

    Google DeepMind 宣布为 Private AI Compute 平台引入私密的服务端记忆层,让 AI 在跨设备间保持长期连续性的同时维持与端侧处理同级的隐私标准。

    推荐理由:原文给出安全飞地、加密通道与设备端密钥相结合的架构细节,可迁移到其他需要云上持久记忆的隐私保护设计中。