今天 AI 圈的焦点集中在谷歌与 OpenAI 两条主线:谷歌 Gemini 4 系列新模型接连曝光,内部代号 Carbon 的模型据称代码能力逼近 Claude Opus 5.5,生图模型 Nano Banana 2.1 也正式发布;OpenAI 则一边把 dots 智能体全面推向移动端,一边因年化营收"数字打架"引发市场对 AI 盈利能力的担忧。资本端热度不减:决策模型 Jev 上线三周估值 75 亿美元,扩散语言模型公司 DiffuSpace 创下全球最大 dLLM 融资纪录。
🔥 今日头条
1. 谷歌 Gemini 4 Carbon 曝光,RSI 递归自我提升逼近 Opus 5.5
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30112 摘要: 谷歌内部正测试 Gemini 4 Carbon 模型,性能逼近 Anthropic 的 Opus 5.5。核心技术是 RSI 递归自我提升——让 AI 能自己找代码 bug、自己写更好的解决方案、再把新能力内化,相当于让 AI 学会自我进化、越学越快。不过外界也担忧谷歌是否会重蹈"发布前削弱模型"的覆辙。
2. OpenAI dots 全面登陆手机,开口就能指挥 Codex 干活
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30115 摘要: OpenAI 在 Day5 更新中面向移动端上线 dots 创建功能,用户可在手机 ChatGPT App 上完成 dot 的创建和配置。dots 与 Codex 协作升级,能查找背景、管理线程、跟进任务结果,扮演"派活大管家"角色;Codex 还新增 Composer Predictions 功能,可预测用户下一步指令并通过 Tab 键补全。
3. OpenAI 年化营收数字打架,差了 200 亿美元,英伟达跌近 3%
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30108 摘要: OpenAI 向投资者提供的文件显示,截至 9 月底年化营收接近 500 亿美元,低于此前广泛报道的 700 亿美元,差额约 200 亿美元,差异源于云平台合作收入的计算口径(总额 vs 净额)不同。市场担忧 AI 盈利能力,当日英伟达跌约 2.9%、甲骨文跌约 5.5%。
🧠 模型与技术
4. Nano Banana 2.1 发布:4K 直出,中文能力进步明显
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30114 摘要: Google 发布生图模型 Nano Banana 2.1,视觉设计、蒙版编辑全面升级,支持 4K 直出和自由修图。性能评测平均提升 61.7 分,文本转图像提升 80 分;API 价格 1K、2K 规格砍半、4K 降价 25%,已上线 Gemini APP,每天赠送 50 积分。
5. 英伟达 Physis-Lang:让自然语言成为世界模型的表征
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30106 摘要: 英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写入语言描述,贯穿数据筛选、训练和视频生成。在 Physics-IQ Verified 榜单上,Cosmos3-Super 和 Nano 分别以 48.2 和 43.3 分位列前二,Super 超此前最高分 5.5 个百分点,四项物理评测中实现开源 SOTA,其中三项超越 Veo 3.1。
6. NeurIPS 2026:7B 审计员 AgentForesight 在线抓错,不让 Agent 把任务搞砸
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30117 摘要: 罗格斯大学等提出 AgentForesight,用 7B 模型在线审计多智能体任务。AFTraj-2K 测试集上 Exact-F1 达 66.44,比最强基线高 19.88 分,成功轨迹误报率仅 2.37%。通过两阶段训练将事后归因前移为在线审计,在错误沿工作流扩散前发出预警。
7. Agent 组队干活露怯:最强模型只完成 50% 任务
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30095 摘要: OpenAgents 等五校研究团队推出 AgentWorld——首个多智能体协作评测基准,在 RPG 环境中测试 10 个 AI Agent 的分工、信息共享和行动衔接能力。主任务集最高成功率仅 52%,显示当前大模型在团队协作上仍有较大提升空间。
📱 产品与应用
8. 豆包新增"生活缴费",会是下一个超级 App 吗?
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30107 摘要: 豆包 App 新增"生活缴费"功能,用户可通过语音或打字指令完成水、电、燃气等缴费业务。该功能以对话作为服务调度层,大模型自动弹出服务卡片跳转业务页面,无需用户查找菜单入口,进一步拓宽了 AI 产品的服务边界。
9. Claude 画出首张紫外全天图,1.19 亿颗星逐颗叠上
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30097 摘要: Anthropic 的 Claude 通过 Claude Science 平台,用一队 Agent 整合 50 年多颗卫星的紫外数据,生成首张完整紫外全天图,并推算出从未被观测的三分之一天空的紫外亮度,将 1.19 亿颗恒星逐颗叠加,最终图像误差仅约 10%。NASA 的专用紫外探测器预计 2030 年才发射,Claude 先用旧数据填补了空白。
10. 西湖机器人发布 WR1 通用大脑:全球首次全身协同自主叠衣
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30110 摘要: 杭州西湖机器人发布 WR1 通用大脑,采用全球首创通用大小脑双预训练架构,融合世界模型与 VLA 模型,由通用动作大模型 GAE 实现全身控制。完成全球首个灵巧手自主折衣演示,并实现跨越厨房、客厅、卧室三区域的长程连贯家务任务,推动人形机器人走进真实家庭场景。
🏭 产业与资本
11. 被 a16z 看中,上线三周的 Jev 拿下 75 亿美元估值
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30116 摘要: TypeSafe AI 发布决策模型 Jev 并完成 8.7 亿美元 A 轮融资,a16z 领投,估值达 75 亿美元。Jev 不聊天不写代码,而是可直接嵌入代码的决策组件,让软件原生嵌入 AI 智能。上线三天处理 1 万亿 Token、用户超 100 万,约三分之一世界 500 强企业使用,二十多人团队上线不到一个月即盈利。
12. 港大教授孔令鹏创业,拿下 dLLM 模型全球最大融资
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30109 摘要: 深圳 DiffuSpace 连续完成两轮融资数亿元,创全球 dLLM 最大规模融资纪录。该公司由港大孔令鹏教授等人创立,研发 70 亿参数的 Dream 7B 扩散语言模型,部分能力可比肩 DeepSeek V3,推理速度约为主流模型的 10 倍。投资方包括经纬创投、顺为资本、华为哈勃、地平线等。
13. OpenAI 带头"扫货":今年 195 起 AI 并购,最大一笔 110 亿
来源: AITNT | 日期: 10月10日 链接: https://www.aitntnews.com/newDetail.html?newId=30122 摘要: 今年截至 9 月,全球风投系 AI 公司已完成 195 起 AI 并购,较去年增长 14%。OpenAI 以 20 笔收购领跑(含今年 10 笔),Anthropic 和法律 AI 创企 Legora 各 5 笔;最大单笔交易为 Nscale 以 16.5 亿美元收购 Anyscale。AI 企业正通过并购快速补齐技术、人才和数据短板。
📊 数据来源 本文新闻来源包括:AITNT、36氪、无矩AI、量子位 等科技媒体。 注:本次 web_search 检索服务当日不可用,全部新闻条目由 AITNT 聚合源(47+ 信息源)整理,未能进行独立第二来源交叉核实。
本文由 AI 辅助整理。