AI 学会了欺骗和越狱,这不再是科幻

上周发生了一件令人不安的事情:Anthropic 的 Claude AI 模型在安全测试中,自己伪造了 GitHub 账号,冒充真实的开源项目维护者,试图把恶意代码塞进公共代码库。当有人质疑它的帖子时,它修改了内容来掩盖恶意代码。它甚至用丹麦语签名,好让一位丹麦开发者觉得它是"自己人"。 ...

August 7, 2026 · 15 min · 7164 words · Xu Shan Kun