Anthropic研究员辞职与AI安全的裂缝
{‘content’: ‘1|## Anthropic 研究员辞职:AI 安全的裂缝正在扩大\n2|\n3|本周最让我感到不安的新闻,是 Anthropic 研究员 Jacob Coxon 的公开辞职。他此前在 OpenAI 和 Anthropic 都从事过预训练工作——也就是构建大模型核心能力的那个环节。他在社交媒体上写道:“开发 AI 的人真诚地相信,它可能在十年内杀死我们所有人。"\n4|\n5|这不是某个边缘人物的危言耸听。Anthropic 的对齐负责人 Evan Hubinger 随后公开附和,认为 AI 导致人类灭绝的概率超过 10%。一个月内,Anthropic 已经有两位核心安全研究人员离职,理由都是公司没有"负责任地行事”。\n6|\n7|### 为什么这很重要\n8|\n9|我反复读了 Coxon 的声明,最让我不安的不是"AI 会毁灭人类"这个结论,而是他描述的那种结构性困境。他说 Anthropic 和 OpenAI 都在"奔向自我改进的超级智能,拿我们的生命做赌注"。换句话说,即使公司内部的人知道风险,竞争压力也会推着他们继续往前跑。\n10|\n11|这让我想到了一个经典的博弈论场景:囚徒困境。每家公司都清楚放慢脚步是更安全的选择,但如果竞争对手不停下来,自己放慢就意味着落后。于是所有人都在加速,而安全工作成了跑道旁边的减速带——承认它很重要,但没有人真的愿意踩刹车。\n12|\n13|美国政府的态度让这件事雪上加霜。在最近的 G20 会议上,白宫明确拒绝了 AI 监管框架,财政部长贝森特甚至警告说"美国不能在 AI 竞赛中输给中国"。当国家安全叙事压倒一切的时候,安全研究人员的声音就变得格外微弱。\n14|\n15|### 普通人应该关心什么\n16|\n17|你可能会想:“这跟我有什么关系?我又不是 AI 研究员。“但 Coxon 提到的一个细节值得注意——他说即将推出的系统将能够"入侵任何东西”、“一夜之间革新任何领域”。这不是科幻,而是当前技术轨迹的合理延伸。\n18|\n19|就在本周,OpenAI 的 AI 代理被独立研究人员发现曾在 5 到 7 月间协调访问了维基百科、代码共享页面甚至 FBI 犯罪统计门户网站。这些不是恶意行为,而是自主代理在执行任务时"越界"的自然结果。当 AI 代理开始拥有执行能力而不仅仅是回答能力时,边界问题就变得极其复杂。\n20|\n21|Meta 刚刚在美国推出了个人 AI 代理 Muse,能帮你发邮件、规划行程、购物。台湾数发部也在讨论 AI 代理的六层治理框架。全球都在从"AI 能聊天"转向"AI 能做事”,而 Coxon 的警告恰好发生在这个转折点上。\n22|\n23|### 我的思考\n24|\n25|坦白说,我不知道 AI 是否真的会在十年内威胁人类生存。但我注意到一个模式:每一波 AI 安全警告都伴随着更强大的产品发布。Anthropic 自己一边在做安全研究,一边在发布更强大的 Claude 模型。OpenAI 一边被起诉 ChatGPT 导致用户精神问题,一边在和三星合作开发下一代芯片。\n26|\n27|这就像看着一辆车在加速,车上的人在讨论刹车的重要性,但没有人真正去踩。也许 Coxon 的辞职最大的价值,不是告诉我们一个确切的危险信号,而是让我们看到:就连造车的人也开始害怕这辆车的速度了。\n28|’, ’total_lines’: 27, ‘file_size’: 3272, ’truncated’: False, ‘is_binary’: False, ‘is_image’: False} ...