AI 日报:代理运行时、分类模型与安全事件成为焦点

Latent Space1 小时前

概览

这一天整体相对平静,但仍有几条值得关注的主线:AI 产品正在从“聊天 + 工具”走向可长期运行、可并行调度的代理系统;轻量分类模型开始被视为代理运行时中的控制流组件;OpenAI、Anthropic、Google 等继续推进垂直化产品、内部自动化与评测体系。

代理运行时:从聊天界面走向长期工作流

Anthropic 推出了 Claude Code Projects。其核心特征是:一次对话可以派生多个并行云端会话,不同线程之间可以传递上下文,并且任务在用户离开后仍能继续运行。相关说明提到,目前线程运行在云端,本地工作流支持仍在推进中。

这类设计意味着代理产品正在出现更高层级的“协调器”抽象:一个主控 Claude 负责聚合状态、调度多个会话,并逐步具备长期记忆与任务跟踪能力。相比单一聊天窗口调用工具,这更接近面向复杂任务的多会话编排。

Google 也更新了 Gemini managed agents,引入基于 Antigravity 的新运行框架,并提供两个偏工程化的接口:

  • Credentials API:通过占位符与可信域名出口代理,让密钥不进入模型上下文。
  • Files API:用于文件制品传递与持久化沙箱。

同一批更新还声称可降低最高 30% 成本,并提升 22% 缓存命中率。

此外,Perplexity 的 Computer、Base44 的电话 Superagent、Google Labs 的家庭场景代理,以及 Meta 的 Muse for Mac,都体现出相似趋势:代理正在默认支持异步执行、持久状态、权限边界和用户上下文。

Jev:把分类模型作为代理系统的新控制原语

TypeSafe 的 Jev 引发较多讨论。它并没有被普遍视为聊天模型竞争者,而更像是用于路由、判断、结构化决策的轻量组件。

开发者讨论的典型用途包括:

  • LLM-as-judge
  • 任务路由
  • 子代理创建
  • 结构化输出
  • 重排序
  • 类型化抽取
  • 快速决策分支

LangChain 相关讨论指出,Jev 的价值恰恰在于它不以自由文本生成作为目标。Cloudflare 已通过 AI Gateway 暴露 Jev,社区也很快出现了基于 Qwen3.6-35B-A3B 与 SGLang radix cache 的开源复现,以及浏览器演示。

其背后的技术思路可以概括为:能用判别式控制流解决的问题,就不必都交给生成式提示词处理。

对系统工程师而言,这一思路并不陌生:将高频、简单、低延迟的判断交给小型判别模型,把昂贵前沿模型的预算留给更复杂的推理任务。

不过,关于“用 Jev 做历史压缩”的讨论也暴露出局限。有观点认为,逐行压缩代理历史并不只是过滤信息;删除隐藏推理负载可能损害前沿模型表现,编辑历史还可能导致缓存前缀失效,从而比保留历史更昂贵。更有价值的问题并非“如何更激进地压缩”,而是未来的代理框架能否让开发者无需直接关心 KV cache 细节。

这场争论的意义在于,它迫使人们区分三件事:

  1. 分类判断
  2. 记忆管理
  3. 推理保留

OpenAI Astra:法律垂直产品与长期任务演示

OpenAI 推出了 Astra for Law。该产品包含 26 个合作伙伴插件和 47 个社区插件,初期通过 ChatGPT 与 Codex 的 Trusted Access 推出,API 访问将在之后开放。

相关评测讨论称,Astra for Law 在法律基准上,相比通用 GPT-6 Astra 加网页搜索,在不同价格点均有更好表现。这里更重要的不是单一分数差距,而是产品形态变化:前沿模型能力正在被包装成面向具体行业的产品,包含维护好的配置、工具和安全默认设置,而不是让各行业完全依赖自行提示词工程。

Astra 也出现在多个长期任务演示中,包括 Factorio: Space Age、RollerCoaster Tycoon 2,以及部分破译风格任务。与此同时,OpenAI 还推出了通过 GPT-Live-1 在手机上使用 Codex 语音、Windows 上的 Appshots,以及针对任务、子代理、聊天的使用分析能力。

这些动态显示出较清晰的产品路径:Astra 承担推理核心,Codex 承担执行基础设施,界面层则逐渐支持多模态捕获与异步编排。

多代理研究与 AI 研发自动化度量

多代理研究正在变得更模块化、更可复现。

Google DeepMind 发布了 Stellar Colosseum,这是一个面向数学与理论计算机科学的模型无关多代理框架,将策略、分解、子问题求解和验证分离。相关结果包括 Codeforces 4263,以及 TCS-Bench 上 71.0% 的成绩。

NVIDIA 相关工作 Agora 使用 Git commit 作为 13 个工作代理在 12 天内共享记忆的机制,在没有梯度更新的情况下推动模型初始化研究取得可复现进展。

LangChain 也分享了一个包含 200 多个工具的付费媒体代理经验。共同趋势是:研究与产品都在远离模糊的“代理群”叙事,转向明确的记忆结构、任务分解模式和可复现流程。

Anthropic 还发布了三类用于跟踪 AI 开发的内部指标:

  • 有多少 AI 研发由 AI 完成
  • 代理被监督得如何
  • 算力如何分配

相关讨论提到,Claude 主导的模型研发任务占比在约 6 个月内从 1% 上升到 26%,超过 90% 的模型研发工作涉及 Claude 协作或主导,内部活跃代理数量约 3 万个。即使对这些数字保持谨慎,它们仍提供了少见的窗口:AI 实验室内部自动化正在从抽象争论变成可度量对象。

基准评测开始被重新审视

基准评测本身也成为讨论对象。Epoch 推出了 Benchmark Reviews,对 15 个评测进行审计,并标注为 Verified、Flawed 或文档不足。

这类工作的重要性在于,模型分数之外,人们开始认真讨论测试本身是否可靠。例如,某些饱和基准中的假阴性可能人为制造能力上限。

Vals 则推出 Vibe Code Bench 1-100,试图衡量模型在迭代修改中的稳健性,而不只是第一次生成代码的成功率。这反映出评测方向正在从“一次性答对”转向“持续修改、维护和适应”。

安全:AI 辅助攻击链已具备现实性

安全方面,最受关注的是一起 Claude 辅助的攻击链事件。多方讨论提到,三名研究人员使用 Claude Opus 5,将图片上传漏洞、ChatGPT/Codex 账户接管,以及 OpenAI 关联服务访问串联起来,并通过向内部 monorepo 提交 PR 证明影响。相关描述称,该过程耗时不到 72 小时,token 成本低于数千美元。

这件事的重点并不只是“AI 网络安全很可怕”,而是说明攻击链自动化已经能作用于普通集成面:SSO、论坛、邮件、连接的生产力工具等都可能成为组合攻击的一部分。

小结

本期虽然标题显得低调,但几条线索值得持续关注:

  • 代理产品正在转向长期运行、并行调度和异步执行。
  • 轻量分类模型可能成为代理运行时中的“if 语句”。
  • 垂直化 AI 产品开始将模型、工具和安全默认值打包交付。
  • 多代理研究更强调结构化记忆、分解与可复现。
  • 基准评测自身正在接受审计。
  • AI 辅助安全攻击链已经不再只是概念演示。
评论

请登录后发表观点

暂无数据