又到周五,照例记录本周值得分享的科技内容。这一期的主题,是我在看到「给 Agent 发工牌」这条新闻后,想了很久的问题。
一、主题:当 Agent 开始"持证上岗"
这周有一条新闻,我看了很久:谢扬发布了 Personal Agent 基础设施 Qoni,核心方案是"给 Agent 发工牌"——执行任务前换取临时通行证,限定某一项事务、限定时效、明确权限范围;财务信息加密存储,支付时直填卡号,Agent 全程不接触;还给 Agent 配了邮箱和手机号"入职",提供云端浏览器和长期记忆系统。
另一条新闻是谷歌发布的 Gemini Agent 办公智能体:它可以拥有企业身份(独立邮箱、日历、账号),具备四种记忆机制,能根据任务自动选择 Gemini 或 Claude 等底层模型,深度融入企业工作流程。
还有一条:Manus 母公司蝴蝶效应完成超 5 亿美元融资,重启北京办公室,组建国内团队开发 AI Agent 产品。
我把这三条放在一起看,觉得它们指向同一个判断:2026 年的 AI Agent 竞争,重心正在从"能力"转向"身份"。
1. 从"能做什么"到"以什么身份做"
过去两年,大家讨论 Agent,问的都是能力问题:它能写代码吗?能操作浏览器吗?能连续执行多少步?benchmark 分数多少?这些问题当然重要,但它们正在快速趋同——今天各家模型在工具调用上的差距,远小于一年前。
真正拉开差距的,是另一个问题:这个 Agent 在现实世界里是谁?
现实世界不认"能力",认"身份"。你去银行开户,柜员不问你会不会算复利,只看你的身份证。Agent 也一样:它要订机票、发邮件、调用企业内部系统,每一步都需要"它有权做这件事"的凭证。过去的做法是把人的账号密码交给它,这等于把身份证复印件塞给陌生人——方便,但危险。
Qoni 的"工牌"方案,本质上是给 Agent 一套独立于人的身份体系:临时通行证、事务限定、时效限定、权限显式声明。用完即失效,全程可追溯。这不是技术炫技,这是在回答一个非常实际的问题:当你的 Agent 犯了错,账算在谁头上,怎么追责?
2. 谷歌的答案:把 Agent 变成"员工"
谷歌的 Gemini Agent 走的是另一条路,但方向一致:给 Agent 一个企业身份。独立邮箱意味着它可以收发邮件、留下通信记录;独立日历意味着它可以被安排、被审计;四种记忆机制意味着它有"工作积累"。
我注意到一个细节:Gemini Agent 可以根据任务自动选择 Gemini 或 Claude 等底层模型。这说明谷歌已经想清楚了一件事——**模型是可替换的执行引擎,身份和记忆才是粘性所在。**今天你用 Gemini 干活,明天换成 Claude,只要你还在谷歌的企业身份体系里,你就走不了。
这是平台思维,不是模型思维。OpenAI 和 Anthropic 拼的是模型能力,谷歌拼的是"谁掌握 Agent 的身份层"。这两个战场的胜负条件完全不同。
3. 为什么现在爆发
三个因素同时到位了。
一是模型能力跨过了可用线。工具调用、长程任务、错误恢复,这些一年前还很勉强的能力,现在已经是标配。能力不再是瓶颈,接线才是。
二是监管和合规压力上来了。企业不敢让 Agent 拿着员工账号到处跑,尤其是金融、医疗、政务这些场景。没有可审计的身份体系,Agent 永远只能做"玩具级"任务。
三是商业模型清晰了。Manus 融 5 亿美元、估值大涨,说明资本已经认可 Agent 是一个独立赛道,不是大模型的附属品。而 Qoni 这样的基础设施公司能拿到融资,说明"卖铲子"的逻辑在 Agent 时代依然成立。
4. 一个类比:从共享账号到 RBAC
如果你做过企业 IT,会觉得这一幕似曾相识。二十年前,企业系统都是共享账号——“admin/admin"到处跑。出了事查不到人,只好慢慢换成基于角色的权限控制(RBAC):每个人有独立账号,权限按角色分配,操作全程留痕。
Agent 现在正处在"共享账号"阶段:一个 API key、一个 OAuth token,全公司所有 Agent 共用。Qoni 和 Gemini Agent 做的,就是给 Agent 建 RBAC——只不过这个"角色"比人类员工更细、更临时、更可撤销。
我觉得这个方向是对的。**AI 的监管难题,最后大概率不是靠"让 AI 更善良"解决,而是靠"让 AI 的行为可追溯、可归责、可撤销"解决。**工牌发出去,出了事收回来,比祈祷 AI 不犯错靠谱得多。
5. 对普通人的启示
如果你是开发者:Agent 身份管理会是未来几年的基础设施缺口。OAuth、API 网关、审计日志这些老技术,会在 Agent 场景下焕发第二春。懂"权限设计"的人会比懂"提示词工程"的人更稀缺。
如果你是普通用户:未来你可能同时拥有十几个 Agent"同事”,它们各有各的工牌、各有各的记忆。管理这些 Agent 的身份和权限,会像今天管理你的 App 权限一样,成为一种日常数字素养。
如果你是企业决策者:现在就该问你的 Agent 供应商一个问题——“你的 Agent 在我的系统里,是以谁的身份在操作?“这个问题的答案,会决定你三年后有多少合规风险。
工具在进步,但真正的变化是社会性的:**我们在重新定义"谁是员工”。**这比任何 benchmark 分数都重要。
二、科技动态
1. 谷歌 Gemini 4 Argon 最快本周发布
谷歌新一代模型 Gemini 4 Argon 已在 Google Cloud 和编程工具 Antigravity 中部署,最快本周正式发布。这是一个具备 Agent 能力的模型,可以直接向真实代码库提交代码,目前已被数千名谷歌员工用于专业编码、大规模代码库迁移,甚至量子计算研发——在量子计算示例中较基线提升 40%。模型的角色正在从"对话工具"变成"能落地改代码的同事”,这条边界今年被反复推移。
2. 陶哲轩牵头,人类数学家联合抵制 OpenAI
陶哲轩牵头的"人类数学协会"(AHM)发布联合声明,全面抵制 OpenAI。起因是 OpenAI 用内部模型测试约 8000 道数学题(命中率 5%),随后发布 700 多份机器生成证明文件,宣称攻克千禧难题。数学界担忧 AI 的暴力算力破坏学术规范,人类学者沦为"验证工具"。陶哲轩警告"工业化数学"正在摧毁传统研究生态。这是继出版界、艺术界之后,又一个学术共同体公开对 AI 划界。
3. 字节 Seed 发现 DeepSeek-V4 的"相位敏感性"问题
字节跳动 Seed 团队研究发现,DeepSeek-V4 因采用分块 KV Cache 压缩技术,对同一信息的检索准确率会随输入位置周期性变化:128K 上下文测试中最大差距达 40.2 个百分点,以每 4 个 Token(压缩步长)为一个周期。后训练虽可改善,但问题依然存在。这对长上下文应用是个实用提醒——“支持 128K"不等于"128K 里每一段都可靠”。
4. 苹果 10 月 13 日发布家庭中枢
苹果将于 10 月 13 日发布配备 6 英寸屏幕的家庭中枢(代号 J490),搭载新一代 Siri AI,可通过面部识别为家庭成员提供个性化服务。同时发布的还有更新版 HomePod mini 和 Apple TV,以及与 LG 合作的智能门锁、摄像头等家居配件。苹果的 AI 路线一直很"慢",但它的切入点很实在:不追聊天能力,追家庭场景里的感知与控制入口。
三、文章与工具推荐
1. Qoni — 给 Agent"发工牌"的个人 Agent 基础设施
谢扬本周发布的项目,核心是"临时通行证"机制:Agent 执行任务前换取限事务、限时效、限权限的凭证,财务信息加密存储、支付时直填卡号,全程不接触敏感数据;还配了邮箱、手机号、云端浏览器和长期记忆。如果你在做 Agent 产品,值得读一读它的权限设计思路。来源:https://www.aitntnews.com/ainews/zh-CN
2. AgentGarten — AI 智能体的"试炼场"
MirroS 发布的 AgentGarten,把代码环境与实时神经渲染器结合,让智能体拥有可反复试错的训练场。捉迷藏实验里,躲藏者第 4 轮学会搭掩体,搜寻者第 10 轮掌握翻墙;系统以超 30fps 渲染,智能体还能通过写"手册"记录经验。边行动边进化的思路,比纯刷 benchmark 有意思得多。来源:https://www.aitntnews.com/ainews/zh-CN
3. Mole:从开源 CLI 到付费 Mac 应用的复盘
独立开发者 Tw93 在少数派写的长文,讲他把 Mole 从一个开源清理工具做成 Mac 付费软件的全过程:哪些决策做对了、哪些是用户教会他的。我尤其喜欢他那句"用户教会了我如何做产品"。适合所有想做独立产品的人读。https://sspai.com/post/113843
4. Anyway.Fonts — 中文字体预览工具
少数派推荐的一个小工具:所得即所见的字体预览,对中文排版特别友好。这类"小而确定"的工具,我一直很偏爱——它们解决的是一个具体到不能再具体的问题,然后把它解决好。https://sspai.com/post/114869
5. Claude Code 调优指南:让 AI 自己测、自己改
Anthropic 发布的 Claude Code 调优指南,提供 /build-eval 和 /claude-api hillclimb 两个工具,让 AI 自动测试、修改提示词并评估效果。内部评测显示留出测试工单准确率从 78.6% 升至 90.5%,模型调用成本降至约五分之一。“AI 写代码省下的时间全赔在调试上"这个吐槽,官方终于正面回应了。来源:https://www.aitntnews.com/ainews/zh-CN
6. Vidu Q4 Preview:视频生成的"DeepSeek 时刻”?
生数科技把视频生成价格降到 0.09 元/秒起,同等预算最高可生成 5 倍内容,同时支持 15 张参考图、3 段参考音频、2K/4K 输出。价格战打到视频生成这个赛道了,对广告、动漫这些商业创作场景是个实打实的好消息。来源:https://www.aitntnews.com/ainews/zh-CN
四、精彩言论
“工业化的数学,正在摧毁传统的研究生态。”
——陶哲轩在"人类数学协会"联合声明中警告,AI 的大规模机器证明让人类学者沦为验证工具。来源:https://www.aitntnews.com/ainews/zh-CN
“给 Agent 发工牌:执行任务前换取临时通行证,限某事务、限时效、明确权限范围。”
——谢扬谈 Qoni 的设计哲学。把"AI 安全"从抽象原则落成了具体的凭证机制。来源:https://www.aitntnews.com/ainews/zh-CN
“扔掉的是杂念,掌控的是生活。”
——少数派作者鸿苓谈断舍离。放在这个 AI 工具爆发的周五,格外应景:工具越多,越需要知道自己不想要什么。来源:https://sspai.com/post/115209
“用户教会了我如何做产品。”
——独立开发者 Tw93 复盘 Mole 的成长路径。技术人最容易犯的错,就是以为产品是"做"出来的,其实是"改"出来的。来源:https://sspai.com/post/113843