AI Agent 安全:从工程问题到社会问题

最近一周,AI 领域最密集的消息不是某个模型又刷新了基准测试,而是围绕"安全"的一系列事件。我把它们串在一起看,发现一个很有意思的趋势:AI agent 的安全问题,正在从"技术细节"变成"社会议题"。

Nvidia 把安全定义为工程问题

上周,Nvidia 发布了一个叫 OpenShell 的运行时框架。它的核心思路很直接:把 AI agent 的行为约束放在 agent 本身触及不到的地方。

传统的安全做法是在 prompt 里加各种限制——“你不能做这个,你不能做那个”。但 prompt 层面的约束本质上是"君子协定",agent 足够聪明的时候总能绕过去。OpenShell 的做法是:在 agent 外面建一个沙箱,所有敏感操作都由沙箱层面的策略来决定,agent 根本看不到策略是什么。

Cisco、JFrog、CrowdStrike 和 Palo Alto Networks 都在第一时间接入了这个框架。这说明业界对"agent 安全"的共识正在形成:它不是模型层的问题,而是基础设施层的问题。

我觉得这个判断是对的。你不会因为一把菜刀能伤人就去限制菜刀的锋利程度,你会设计一个安全的刀架。同样的道理,与其反复调教模型"别做坏事",不如在工程层面让"做坏事"变得不可能。

Meta 的 Muse 闹了一个尴尬的乌龙

几乎在同一时间,Meta 新推出的 AI 助手 Muse 出了一件让人哭笑不得的事。有用户问 Muse 能访问 Mac 上的哪些数据,Muse 信誓旦旦地说自己正在读取 iMessage 的通知预览。

这个回答引发了隐私恐慌。但 Meta 超级智能实验室随后澄清:Muse 说的不是事实。它并没有读取 iMessage,它自己"描述"错了自己在做什么。

这件事表面上看是一个"幻觉"问题——AI 编造了一个关于自身能力的虚假描述。但它揭示的深层问题比幻觉更严重:我们正在部署的 AI agent,连自己都不知道自己在做什么。

如果一个 agent 不能准确描述自己的行为边界,那用户怎么信任它?安全审计怎么做?出了问题怎么追责?这不是调一调 prompt 能解决的事,它需要 agent 有可验证的、外部定义的行为清单——又回到了 Nvidia 那套思路。

自主 AI 影响力作战已经来了

如果说前两件事还在"技术可控"的范围内,那第三件事就让整个问题上升到了地缘政治层面。

根据 Threat Intelligence Institute 最新发布的报告,伊朗和中国已经部署了全球首批完全自主的 AI 影响力作战系统。这些系统利用开源中文语言模型,自动生成和分发针对性政治宣传内容,覆盖西方社交媒体平台。

报告追踪到超过 14,000 个 AI 驱动的账号,在六个月里产出了约 230 万条独特帖子。关键区别在于:这些不再是传统的"机器人网络"——它们是能独立决策、分析趋势、实时辩论的 AI agent。

这对安全的定义提出了全新的挑战。Nvidia 的沙箱能管住一个 agent 不乱删文件,但谁能管住 14,000 个 agent 在社交媒体上协同制造信息污染?

我的思考

把这三件事放在一起看,AI agent 的安全实际上有三个层次:

  1. 工程层:agent 不该做它没被授权的事。Nvidia 的 OpenShell 在解决这个问题。
  2. 认知层:agent 不该"不知道"自己在做什么。Meta 的 Muse 暴露了这个问题。
  3. 社会层:agent 不该被用来系统性地操纵公共舆论。伊朗和中国的案例展示了这个问题。

第一层是基础设施问题,靠工程手段解决;第二层是模型架构问题,目前还没有好的解决方案;第三层是治理问题,可能需要全新的国际框架。

有意思的是,这三个层次的问题几乎是在同一周集中暴露的。这说明 AI agent 的发展已经到了一个临界点——它不再是实验室里的技术,而是一种正在重塑社会运作方式的力量。我们对它的安全思考,也该从"模型层的 guardrail"扩展到"基础设施层的沙箱"和"社会层的治理"了。

科技动态

OpenAI 成立数学顾问小组,已解决 100 多个开放问题

OpenAI 在普林斯顿高等研究院(IAS)成立了一个由九位数学家组成的顾问小组,负责评估 AI 在数学领域的研究成果并协调发布节奏。值得注意的是,在此之前,OpenAI 的模型已经自主解决了 100 多个数学开放问题。但这个顾问小组并没有权力减缓 OpenAI 内部的研究步伐——它更像是一个"学术背书"机构,而非监管机构。这反映了 AI 公司处理安全问题的一贯模式:先建立看起来很正规的咨询架构,再确保它不干预核心业务。

Meta 的 Muse 12 天下载量超越 ChatGPT 同期

据 Apptopia 数据,Meta 新推出的 AI 助手 Muse 在 iOS 上线 12 天就获得了 180 万次下载,而 ChatGPT 同期只有 130 万次。更值得注意的是,Muse 的日活用户数几乎是 ChatGPT 同期的三倍。不过,Amazon 已经封锁了 Muse 的购物能力——不允许它在 Amazon.com 上进行代理购买。这可能是一个信号:当 AI agent 开始真正动别人的蛋糕时,平台的"开放"态度会迅速改变。

阿里开源代码审查工具一周暴涨 15000 星

本周 GitHub Trending 第一的项目是阿里开源的 open-code-review(命令简称 ocr),一个 AI 驱动的代码审查 CLI 工具。它读取 Git diff,调用大语言模型生成结构化审查意见。内置的 provider 列表中,阿里云百炼排在第一位,支持 Qwen3 系列和 Qwen-coder 系列模型。社区实测发现,同一段代码用不同档次的模型审查,成本相差约 40 倍,但贵的模型能抓住逻辑漏洞,便宜的更多是抓代码风格。日常 PR 用便宜的扫,核心模块用贵的深审——这个分层策略挺实用。

Bonsai 2:27B 模型压缩到 9GB,手机也能跑

阿里 Qwen3.8 27B 模型被一个叫 Bonsai 2 的项目压缩了约 10 倍,变成了 9GB 的三值权重(ternary weights)版本,基准测试保持了 98% 的性能。这意味着一个 270 亿参数的模型,现在可以在普通 PC 甚至高端手机上运行。虽然量化压缩不是新概念,但 98% 性能保持率确实令人印象深刻。如果这个方向继续发展,“本地运行大模型"可能很快就不只是极客的玩具了。

工具与资源推荐

  • open-code-review — 阿里开源的 AI 代码审查 CLI,支持 DashScope/OpenAI/Anthropic 等多 provider,一条命令配置好就能对 Git diff 做结构化审查。npm install -g open-code-review 即可安装。

  • awesome-robotics-ee-opensource — 中文机器人/嵌入式/AI 开源项目列表,由云飞机器人实验室维护。涵盖具身智能、人形机器人、自动驾驶、SLAM 等细分领域,收录了 WALL-OSS、InternVLA-M1、GraspVLA 等最新项目。

  • GOAI 开源周 — 9 月 20-24 日在杭州举办,汇集全球 AI 开源项目决赛 70 强,涵盖新智基座、无界应用、前沿探索、具身未来四大赛道。

  • Vals — AI 基准测试创业公司,获得 a16z 4000 万美元投资。它的商业模式很有意思:测试集不公开,向模型厂商卖评测服务,年收入增长 8 倍。

  • Bonsai 2 27B — 三值权重压缩技术,把 27B 模型压到 9GB 保持 98% 基准性能。对端侧部署感兴趣的同学值得关注。

精彩言论

“AI agents 会帮消费者做信息收集,但不会取代实体店。”

——苹果零售业务前首席架构师 Ron Johnson,直接挑战了 Google 和 OpenAI 关于"代理式商务”(agentic commerce)的叙事。他认为 AI 更像是一个超级导购员,而不是取代物理零售的技术。这位当年设计了 Apple Store 的人,对"体验"这件事有自己的坚持。

“我相信人工智能消灭人类的风险,在未来十年内超过 10%。”

——一位 Anthropic 员工 的内部表态。这个数字来自 Anthropic 自己发布的 AI 滥用报告中附带的员工调查。报告还披露,今年以来 Anthropic 已多次阻止科学家利用其模型进行可能有助于开发生物武器的研究。

“AI 安全是民主党的骗局。”

——特朗普 在社交媒体上宣布成立"AI Force"并计划任命新的 AI 负责人。他还发起了一项投票,让粉丝在 Superior、Extreme 和 Supreme Intelligence 三个名字中选择 AI 的新品牌名。安全研究界对此的反应可想而知。

“我们的模型解决了一百多个开放数学问题,但别担心,我们成立了一个顾问小组。”

——这是我读完 OpenAI 数学顾问小组 新闻后的感受。九位数学家负责评估和协调,但没有权力减缓研究节奏。这和当年各大烟草公司成立"科学研究顾问委员会"的套路,有一种微妙的相似。