图意:代理技术正在从独立演示界面,往网页、文档、后台系统这些原有软件结构里渗透。
过去很长一段时间,Agent 赛道最尴尬的地方在于:它特别会做演示。
开一个浏览器,点几下网页,读一段文本,生成一份报告,配上旁白,效果很唬人。问题是,一旦把它丢进真实环境,麻烦就来了:页面会变,权限会卡,流程会断,用户会反悔,系统会超时。结果就是,大家看了很多很会“表演”的 agent,却很少真的在日常工作里长期依赖它。
过去 24 小时里,一些信号开始显示,Agent 这件事正在发生微妙但重要的转向:它不再只想证明“我能做一整件事”,而是开始证明“我能嵌进现有产品,接管其中一小段麻烦流程”。
GitHub 今天最值得看的两个方向:页面内代理与在线学习代理
先看 PageAgent。这个项目在 GitHub Trending 上来到 5,437 stars,当天新增 1,215 stars。它的描述非常克制:一个 living in your webpage 的 GUI agent,用自然语言控制 web 界面。 真正有意思的不是口号,而是它故意避开的东西——
- 不要求完整的浏览器自动化体系;
- 不把截图和视觉理解当默认前提;
- 不主打“替你上网冲浪”,而是把 agent 变成网页里的一个交互层。
这和过去很多 Computer Use 路线不同。后者更像在训练一个“会用电脑的人”,而 PageAgent 更像在做一个“会嵌进产品的能力模块”。差别听起来很小,落地难度却完全不同。
如果一个 agent 必须拥有浏览器、权限、截图、外部模型和完整执行环境,它更像一个独立操作系统;如果它能直接在页面里理解 DOM、触发动作、接受人工接管,它就更接近 SaaS 可以接受的增强层。
图意:真正更容易落地的 Agent,不一定像“替你操作整台电脑”,而更像“插进现有系统的一层智能交互壳”。
再看 OpenClaw-RL。它在 arXiv 2603.10165 提出一个很有现实感的判断:agent 不应该只从离线数据里训练,用户回复、工具输出、终端状态、GUI 变化,这些本来就是每天都在产生的反馈。对应 GitHub 仓库在 3 月 10 日同步更新,项目方同时放出 terminal、GUI、SWE、tool-call 四条场景实现,并宣称技术报告已登上 Hugging Face Daily Papers 榜首。
这个方向的重点不在“RL”三个字,而在于它试图把 agent 的改进路径从“等团队重新训练一版模型”变成“系统在使用过程中持续吸收反馈”。这很关键,因为 Agent 真正的难点从来不是第一次完成任务,而是第二次别再犯同样的蠢错误。
为什么 Agent 终于开始像产品,而不是舞台道具
这背后有三个结构性变化。
1. 评估标准开始贴近真实工作
smol.ai 当天聚合里提到 Arena 推出了 Document Arena,聚焦 PDF 与文档处理。这个动作的重要性被很多人低估了。过去大家太依赖代码题、数学题和少数 benchmark 去判断 agent 能力,但现实世界里最常见的工作不是解一道抽象题,而是读文档、找信息、整理结构、点界面、处理例外情况。
当评估开始往文档、界面和流程迁移,Agent 的优化方向自然也会变。大家会更关注它是不是稳、是不是好接管、是不是适合和现有软件栈拼起来,而不只是看它能不能独立完成一个高戏剧性的 demo。
2. 产品团队开始接受“半自动”而不是“全自动”
早期 agent 叙事特别喜欢讲“从头到尾全自动完成任务”,因为这最容易赢得注意力。但真实产品里,全自动往往意味着高风险、高权限和高事故概率。相反,可中断、可审阅、可接管的半自动系统,反而更容易进入企业与生产环境。
PageAgent 强调 human-in-the-loop,本质上就是在承认这点:Agent 不一定要取代用户,它更可能先替用户缩短 20 次点击、减少几轮表单填写、把重复解释变成一句话。
3. 训练与使用之间的墙,正在变薄
OpenClaw-RL 代表的思路,则是在拆另一堵墙:系统上线后,不该完全失去学习能力。论文里把“下一状态信号”拆成两类——一种是评价性信号,用来变成 reward;另一种是指导性信号,用 hindsight 去恢复“本来应该怎么做”。这听上去有点学术,但放回产品语境就很清楚:
- 用户重新问一遍,是一种负面反馈;
- 工具报错,是一种环境反馈;
- 页面状态没变,是一种执行失败反馈;
- 用户修正答案,是一种非常高质量的训练提示。
以前这些东西大多被浪费掉了。谁能更好地把它们收回来,谁的 agent 才更可能越用越顺手,而不是越用越让人想砸键盘。
这会怎样改变接下来的 Agent 竞争
如果这个方向成立,Agent 赛道的胜负手会从“谁能做最完整的自动化演示”,转向三项更难、但更有商业价值的能力。
第一项,是可嵌入性。它能不能无痛接进网页、工作台、客服系统、文档流,而不是要求用户重新适应一个全新的代理世界。
第二项,是可恢复性。它出错时能不能被人接住,能不能回滚,能不能解释,能不能在复杂流程里只接管最烦的那一段。
第三项,是可学习性。它能不能利用日常反馈持续修正,而不是每次都从同样的坑里重新摔一遍。
结论
Agent 最有希望的一条路,可能不是成为一个替你完成所有事情的“数字员工”,而是先成为软件系统里一个个非常具体、非常实用的零件。
PageAgent 代表的是“嵌进去”,OpenClaw-RL 代表的是“用起来还能学”。一个解决接入问题,一个解决改进问题。把这两类信号放在同一天看,行业方向已经相当明确:
Agent 正在从一个独立演示品,慢慢长成软件产品里的标准部件。
这条路没有那么炫,也没那么容易出圈,但更像真钱会流过去的方向。因为真正能留下来的技术,通常不是最会表演的那一个,而是最先成为别人产品结构一部分的那一个。