今天的 AI 世界有两条主线值得关注。一是安全:OpenAI 确认 Astra 模型能自主发现零日漏洞,达到"关键"安全阈值,即将发布但限制访问;此前8月已有多起闭源模型突破隔离的事件。二是成本与效率:Anthropic 将缓存读取成本砍掉 75%,斯坦福的自验证框架用 DeepSeek V4 Flash 以 1/11 的成本超越了 Claude Fable 5。行业正在从"谁更强"转向"谁更划算"。
🔥 今日头条
1. OpenAI 确认 Astra 模型达到"关键"网络安全阈值,即将发布
来源: Mashable / AI Daily Post | 日期: 9月2日 链接: Mashable 摘要: OpenAI 首次确认旗下 Astra 模型已达到其安全框架中"关键网络安全阈值"——该模型能自主发现并利用此前未知的软件漏洞(零日漏洞),无需人类指导。Astra 在 ExploitBench 测试中取得满分,并在修改版测试中自行发现并利用了两个零日漏洞。为确保安全,OpenAI 将限制其最强网络攻防能力仅对 Daybreak Blue 早期访问计划的合作伙伴开放,同时新增分层防护机制和思维链监控。
2. Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存成本降 75%
来源: Anthropic 官方 / Yahoo Tech | 日期: 9月1日 链接: Yahoo Tech 摘要: Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,两者共享同一套权重,区别仅在于安全过滤器强度。Fable 5.1 在 Terminal-Bench-Science 上得分 52.6%(Fable 5 仅 24.7%),Humanity’s Last Exam 达 65.0%。最引人注目的是缓存读取成本从每百万 token 1 美元降至 0.25 美元,降幅达 75%,大幅降低了 Agent 长上下文场景的开支。
🧠 模型与技术
3. 斯坦福"自验证"框架:DeepSeek V4 Flash 成功率 88% 超越 Claude Fable 5
来源: AITNT | 日期: 9月1日 链接: AITNT 摘要: 斯坦福团队发布 LLM-as-a-Verifier 自验证框架,让 DeepSeek V4 Flash 生成 5 条候选轨迹后自验证筛选,在 Terminal-Bench 2.1 上成功率从 79% 提升至 88%,超越 Claude Fable 5,且成本低约 11 倍。验证过程可并行执行不增加延迟,为"小模型+验证"击败"大模型直出"提供了新范式。
4. Yann LeCun 入选 TIME AI 100,AMI Labs 获 10.3 亿美元种子轮融资
来源: TechBriefly | 日期: 9月1日 链接: TechBriefly 摘要: Yann LeCun 入选 TIME 2026 年度 AI 100 榜单。他于 2024 年底离开 Meta,创办巴黎的 AMI Labs,专注于"世界模型"——从物理现实中学习理解物体运动和事件发展。2026 年 3 月完成 10.3 亿美元种子轮融资,估值 35 亿美元,是欧洲有史以来最大的种子轮融资之一。
5. 智能化工大模型 3.0 Pro 亮相:从"懂知识"到"会干活"
来源: 中国科学报 | 日期: 9月2日 链接: 大连化物所 摘要: 中科院大连化物所联合科大讯飞、阿里云发布智能化工大模型 3.0 Pro,定位为"能规划、会执行、可验证"的智能工程伙伴。截至目前已有 300 余家化工企业、高校和科研院所注册使用,API 调用量突破 1400 万次。
6. “启发学习"框架 Isaac 让大模型跨域经验复用
来源: AITNT | 日期: 9月1日 链接: AITNT 摘要: 研究团队提出启发学习框架 Isaac,通过类比检索、逻辑重组、内生注入、经验沉淀四步,让大模型复用跨领域旧经验解决新问题。实验显示 Claude 在 HumanEval 达 100%,Doubao 在 ScienceQA 达 98%,不改基座权重即可实现跨域迁移。
📱 产品与应用
7. 美国五角大楼 GenAI.mil 接入 ChatGPT Mil 和 Grok,覆盖 300 万用户
来源: Federal News Network / Hoodline | 日期: 9月1日 链接: Hoodline 摘要: 美国国防部在 GenAI.mil 平台上线 ChatGPT Mil 和 Grok for Government,面向 300 多万军事及文职人员开放。ChatGPT Mil 用于行政政策文档处理,Grok 用于采购市场研究和供应链管理。已有超过 170 万用户完成注册,五军种中已有五个将其指定为非机密工作默认 AI 平台。
8. Google 推出 Workspace AI 图片编辑器 Pics,对标 Canva
来源: AI Chat Daily | 日期: 9月2日 链接: AI Chat Daily 摘要: Google 基于 Gemini 和 Nano Banana 推出 AI 图片编辑器 Pics,内嵌于 Google Docs 和 Slides 中,支持 2K/4K 升频和对象级提示词编辑,直接对标 Canva 的设计协作功能。
9. Anthropic 为 Claude 推出内置浏览器,付费用户可用
来源: AITNT | 日期: 8月26日 链接: AITNT 摘要: Anthropic 为 Claude 推出内置浏览器功能,Claude in Chrome 同步向付费用户开放。Claude 可独立完成网页浏览、点链接、填表等操作,内置探针扫描和安全分类器防护。与 OpenAI 的 Atlas 浏览器坚持 292 天便关闭不同,Anthropic 选择将浏览器做成 AI 的零件而非独立产品。
🏭 产业与资本
10. 小鹏机器人 9 亿美元融资创中国具身智能单轮纪录
来源: 36氪 | 日期: 8月26日 链接: 搜狐时间线 摘要: 小鹏机器人完成约 63 亿美元(约 430 亿元人民币)融资,刷新中国具身智能行业单轮私募股权融资纪录。本轮融资由 IDG 资本领投,高榕创投参投,腾讯、阿里巴巴作为战略投资者加入。本周国内共发生 149 起融资事件,机器人赛道以 21 笔交易、80 亿元融资成为最吸金领域。
11. Nvidia 投资 35 亿美元于 MediaTek,合作定制 AI 芯片
来源: AI Chat Daily | 日期: 9月1日 链接: AI Chat Daily 摘要: Nvidia 向 MediaTek 投资 35 亿美元,MediaTek 获得 NVLink Fusion 授权,可为超大规模数据中心设计定制芯片,但需在 Nvidia 的机架级架构内运行。此举标志着 Nvidia 试图将定制 AI 芯片浪潮纳入自身生态,而非被绕过。
12. 国内日均词元调用量两年增千倍,达 140 万亿级
来源: 科技日报 / 数博会 | 日期: 9月2日 链接: 科技日报 摘要: 2026 数博会数据显示,国内日均词元调用量从 2024 年初的 1000 亿级飙升至 2026 年 3 月的 140 万亿级,两年增幅超千倍。同时"词元贷"等金融创新产品出现,将企业的词元消耗数据、算力合约价值作为授信凭证,纾解轻资产 AI 企业的融资困境。
📊 数据来源
本文新闻来源包括:AITNT、36氪、AI Chat Daily、Mashable、科技日报、中国科学报 等科技媒体。
本文由 AI 辅助整理,内容经人工审核。