一、AI 开始"证明",而人类还在"理解"
这一周,最让我震动的一条新闻,是 Anthropic 的 Claude 模型攻克了渗流理论中的连续相变猜想。这个猜想在概率论圈子里被称为"圣杯",悬了将近七十年,菲尔兹奖得主 Duminil-Copin 在上面倾注了数年心血也没能破解。而 Claude 给出的证明,通过了 Lean 形式化验证——机器检查过,逻辑上没有漏洞。
我盯着这条新闻看了很久。不是因为它多么"科幻",而是因为它让我意识到,我们正在经历一个微妙的转折点:AI 不再只是帮忙查资料、写代码、润色文案,它开始产出人类没能产出的数学结果。
更有意思的是,OpenAI 同时在 GitHub 上公开了 722 份数学手稿,涵盖 372 个问题家族,霍奇猜想、黎曼 zeta 函数这些重量级难题都在其中。这些成果由内部模型在 3 小时内生成,从约 4000 个问题中产出,OpenAI 只验证了其中一部分。“量产"这个词,第一次被用在了数学研究上。
但另一条新闻形成了耐人寻味的对照:数学家陶哲轩从 AI 支持者变成了"减速派”,联合 25 位菲尔兹奖得主,呼吁 AI 公司放慢数学研究的节奏。他的担忧不是 AI 会出错,而是 AI 太快了——快到人类的理解和消化进度几乎为零。用他的话说,这会导致"证明消化不良":我们手里攥着成千上万个被机器验证过的定理,却没有几个人真正读懂它们。
我对此深有感触。技术社区这些年一直在讨论"AI 会不会取代程序员",但陶哲轩提出的这个问题更深刻:当产出的速度远远超过理解的速度,知识本身会发生什么变化?一个定理,如果只有 Lean 的类型检查器"读"过,它还算不算人类数学的一部分?
当然,乐观的声音同样响亮。Anthropic 强化学习技术负责人 Sholto Douglas 预测,AI 可能在几年内超越所有人类,完成人类在电脑上做的所有工作;他预计 2028 年 AI 年度资本开支达到 4 万亿美元,2030 年代初全球 GDP 翻倍。他描绘的未来里,地球上每个人都能享有今天首富也无法拥有的富足。
两种判断,我都愿意认真对待。技术乐观主义给了我们动力,而陶哲轩这样的减速派给了我们刹车。一个健康的生态,大概两者都需要。
一个 4B 参数的"会下棋也会讲棋"的小模型
在大模型的喧嚣之外,陈丹琦团队的 QUEEN 模型反而让我眼前一亮。它只有约 4B 参数,融合了棋类引擎 Leela 和语言模型 SmolLM3-3B,棋力达到 2697 分,接近特级大师水平——但更妙的是,它还能用自然语言讲解走棋思路。
经过七轮迭代训练,它的棋力从 1782 分提升了 915 分。这个工作填补了"会下不会说"的空白:以前的棋类 AI 是黑箱,下得出好棋但说不出为什么;以前的语言模型会讲解但棋力平平。把两者缝合起来,得到的是一个既能下又能教的对手。
我喜欢这类工作的理由很简单:它不追求参数规模的军备竞赛,而是问"一个足够小的模型能做什么"。在手机上跑得动的 4B 模型,加上一个好的领域引擎,也许比万亿参数的通用模型更接近"有用"。
开源与小工具:手绘讲解视频的自动化
虾蛄 AI 开发的 handdrawn-explainer 工具也值得一说。输入一个主题,它就能自动生成"边讲边画"的手绘讲解视频:AI 负责写稿、规划画面、生成绘画脚本,配音与动画同步。作者已经在英语教学、数学解题、物理概念等场景做了验证,甚至测试了 20 秒的样片,工具上传到了 SkillHub 供公众使用。
这正是我心目中 AI 工具该有的样子:不是替代创作,而是把"我想讲清楚一件事"的门槛降下来。以前做一段手绘讲解视频,要写脚本、画分镜、录配音、对时间轴,一个人能做但很累。现在这些环节被串起来了,创作者可以把精力放在"讲什么"和"怎么讲得更好"上。
工具的价值,往往不在于它多聪明,而在于它把哪些人带进了创作的门槛之内。
二、科技动态
Google 发布 Nano Banana 2 图像模型,价格砍半
Google 发布了 Nano Banana 2.1 图像模型,价格仅为上一代的一半,性能却超越了旗舰 Pro。它支持蒙版局部编辑、主体一致性保持(可参考 14 张图),在 Arena 多图编辑榜上排名第四,支持 4K 直出。Gemini App 等平台今天起陆续上线,旧 API 将于 10 月 29 日关停。图像生成这条赛道的竞争节奏,已经快到按周计算了。
来源:AITNT
OpenAI 正式启用文本水印技术 textGrain
OpenAI 正式启用了文本水印技术 textGrain,以满足欧盟 AI 法规要求。这项技术由"统计学诺奖"得主苏炜杰主导开发,核心是通过"熵预算"机制控制水印强度。加水印后模型性能无显著差异,400 词段落的检出率约 95%——但同义词替换 25% 后,检出率降至 17%。检测器目前仅向研究机构和专业人士开放。“AI 生成内容可追溯"听起来美好,实际对抗成本却低得令人担忧。
来源:AITNT
Mistral 发布 Large 4 模型,代号"大胖猫”
Mistral 发布了 Large 4 模型,总参数 1.05T,但每个词只激活 49B,训练用了 4000 张英伟达 GB200 GPU。它采用混合专家架构,支持文字和图片输入,具备 1M 上下文,在代码、法律、财务、视觉等基准测试中领先。权重将于 10 月 27 日开放,API 已上线。欧洲的开源阵营,总算有了一个能打的旗舰。
来源:AITNT
Claude 中文版悄悄上线
Anthropic 悄悄为 Claude 添加了中文界面支持,网页和桌面端已上线简体中文和繁体中文。结账页可选择 China,Pro 套餐 20 美元/月,Max 套餐 200 美元,但官方支持地区名单仍无中国大陆。a16z 榜单中 Claude 收入升至第 2,ChatGPT 的付费领先优势从 8 倍缩至 3 倍。全球化产品的本地化,往往就是这样"悄悄地进村"。
来源:AITNT
三、工具与文章推荐
handdrawn-explainer(SkillHub)——输入主题自动生成"边讲边画"的手绘讲解视频,AI 写稿、规划画面、配音与动画同步。适合教学、科普类创作者。
QUEEN 模型(论文与代码)——4B 参数的棋类语言模型,棋力接近特级大师,还能用自然语言讲棋。小模型 + 领域引擎的思路值得借鉴。
Lean 形式化验证(Lean 官网)——Claude 的渗流理论证明通过了 Lean 验证。想了解"机器检查的数学"是什么,从这里开始。
Utopai PAI 制作系统(AITNT)——把剧本、角色、场景、镜头和修改记录整合在同一工作台,解决长篇影视制作中的角色一致性问题。AI 视频从"生成工具"走向"生产基础设施"。
Mistral Large 4(Mistral 官网)——1.05T 参数、49B 激活的混合专家模型,权重 10 月 27 日开放。开源旗舰的新标杆。
textGrain 水印技术(OpenAI)——研究 AI 生成内容溯源的必读案例,“熵预算"机制的设计思路很精巧。
四、精彩言论
“AI 在生成解答和形式化验证上加速,但人类理解和消化进度为零,这将导致’证明消化不良’。”
——数学家陶哲轩,联合 25 位菲尔兹奖得主呼吁 AI 公司放慢数学研究节奏。来源:AITNT
“AI 可能在几年内超越所有人类,完成人类在电脑上做的所有工作。地球上每个人都能享有今天首富也无法拥有的富足。”
——Anthropic 强化学习技术负责人 Sholto Douglas。来源:AITNT
“AI 直接给出答案会抹杀数学家的创造力,AI 生成内容若污染训练数据,后果难料。”
——陶哲轩谈数学研究的 AI 化风险。来源:AITNT
“加水印后模型性能无显著差异,但同义词替换 25% 后检出率降至 17%。”
——OpenAI textGrain 技术报告,道出了内容溯源的现实困境。来源:AITNT