← 返回文章归档

AI 日报 2026.03.12

【AI 日报】2026-03-12|便宜模型继续下探,代理开始从会说话走向会干活

AI Daily

图意:过去 24 小时的 AI 叙事,不再只是模型谁更强,而是价格、可部署性和代理落地一起往前拱。

如果只看热搜标题,今天像是几条彼此无关的新闻:Google 继续压低 Gemini 3.1 Flash-Lite 的价格,OpenAI 一边给 GPT-5.3 Instant 修语气,一边提前放出 GPT-5.4 的烟雾弹;GitHub Trending 上,微软的 BitNet 和阿里的 PageAgent 同时蹿高;研究侧又冒出一篇把“和 agent 说话”直接变成训练信号的 OpenClaw-RL。

但把这些信号叠起来看,轮廓其实很清楚:行业关注点正在从“谁的模型排行榜第一”滑向“谁能把模型变成更便宜、更能嵌进产品、还能持续自我改进的系统”

这个判断不是拍脑袋。smol.ai 当天聚合里最强的共振主线,正是三件事一起冒头:一是 Google 把高吞吐模型进一步打成“基础设施价格”;二是 Qwen 团队动荡让人重新看到开源供给链的脆弱性;三是 agent 工程从 benchmark 走向真实工作流,大家开始讨论文档处理、界面操作和在线反馈训练,而不是只盯着代码题。

先说最现实的一刀:价格还在往下切

Gemini 3.1 Flash-Lite 的关键词不是“最聪明”,而是“够聪明,而且足够便宜”。根据当天 smol.ai 汇总的 Google/DeepMind 发布信息,这个模型给出的价格是 每百万输入 token 0.25 美元、每百万输出 token 1.50 美元,同时保留 100 万 token 上下文。Jeff Dean 转发时还给出两组特别适合做产品决策的数据:LMArena Elo 1432GPQA Diamond 86.9%

这类数字的意义,不在于它是不是今天全网第一,而在于它已经把“低成本可大规模调用”推到一个更危险的位置:原本很多团队会把多模态解析、表单理解、轻推理和文档结构提取拆成一堆规则和 parser,现在开始认真考虑,干脆直接上模型。

Cheap Models

图意:模型竞争的焦点越来越像云计算定价战——吞吐、延迟和单位成本正在重写产品设计。

OpenAI 这边则是另一种打法。smol.ai 汇总显示,GPT-5.3 Instant 过去 24 小时向 ChatGPT 用户推开,官方重点不是“更强”,而是“没那么烦人了”:更自然、没必要的拒答更少,同时官方口径提到接入搜索时幻觉下降 26.8%不接搜索时下降 19.7%。这说明 OpenAI 也很清楚,用户现在对模型的耐心正在下降——不是每个人都愿意为那种一本正经的废话买单。

一个有点残酷但很真实的趋势是:2026 年的模型竞争,开始越来越像“云服务体验竞争”。最先赢得预算的,不一定是最会考试的,而是最便宜、最稳、最少废话、最容易嵌进现有流程的。

第二条主线:代理开始从“演示好看”转向“可嵌入、可交互、可训练”

GitHub Trending 今天很说明问题。阿里的 PageAgent 拿到 5,437 stars,当天新增 1,215 stars。它的核心卖点很直接:不依赖截图,不强依赖多模态,也不需要完整的浏览器自动化栈,而是直接在网页内做自然语言 GUI 控制。这套思路为什么能引发关注?因为它瞄准的是一个特别现实的需求——不是做一个会炫技的通用代理,而是把“帮用户在现有网页里完成动作”变成一个能接进 SaaS、ERP、CRM 的组件。

同样值得看的是研究侧的 OpenClaw-RL。它在 arXiv 2603.10165 中提出的关键观点很朴素:用户回复、工具输出、GUI 状态变化,本质上都是“下一状态信号”;如果这些信号本来就天天在产生,那 agent 为什么不能一边被使用,一边从这些反馈里继续学?对应 GitHub 仓库也在 3 月 10 日同步放出,项目方宣称已登上 Hugging Face Daily Papers 榜首。

这条线真正有意思的地方,不是“又一篇 RL 论文”,而是它把 agent 训练从实验室里的静态数据集,往真实使用场景里拖。过去很多 agent 讨论卡在一个尴尬点:demo 里看着很像,真实环境里一碰就碎。OpenClaw-RL 试图解决的,恰恰是这个断层——让“你刚刚做错了,所以我重新问一遍”不只是用户抱怨,也能变成训练材料。

smol.ai 的当天聚合里还有一个共振点:Arena 推出了面向 PDF 与文档处理的 Document Arena。这个动作本身就在提醒行业,代理能力的评估标尺在变。以前大家太喜欢拿代码题和数学题当通用能力代理,但真正能进办公室、客服台、文档流和业务系统的 agent,未必靠这些题型决胜。

第三条主线:边缘部署和低比特推理,开始从口号往“能用”落

今天 GitHub Trending 里爬得最快的项目之一是微软 BitNet:仓库 31,091 stars,当天新增 2,149 stars。如果只把它理解成“又一个模型 repo”,会错过重点。BitNet 官方框架给出的数字很扎眼:在 CPU 上,1-bit/1.58-bit 这一路推理方案可实现 1.37x 到 5.07x 的加速,能耗下降 55.4% 到 70.0%;在 x86 CPU 上,速度提升可到 2.37x 到 6.17x,能耗下降 71.9% 到 82.2%。官方还给了一个很适合传播的说法:100B 级 BitNet b1.58 模型可以在单颗 CPU 上跑到接近人类阅读速度,也就是每秒 5 到 7 token

Edge AI

图意:当低比特推理真正跑进 CPU 和边缘设备,AI 的竞争会从“谁能训练出来”转向“谁能大规模部署”。

这件事和 Gemini Flash-Lite 看似是两条线,实际上却在同一个方向上汇合:一边是云端单位成本继续下探,一边是端侧可运行性继续上升。两头一起压,会逼着更多产品团队重新思考架构分工:哪些任务留在云上,哪些任务下沉到设备侧,哪些任务甚至可以在没有昂贵 GPU 的情况下完成。

这一天里最值得警惕的,不是新模型,而是开源体系的脆弱性还在发酵

虽然今天没有必要再把昨天 Qwen 团队动荡重写一遍,但它仍然是过去 24 小时议题选择的背景板。原因很简单:当 PageAgent、BitNet、OpenClaw-RL 这样的项目被追捧时,行业表面上像是在变得更多元;可另一面,真正能长期维护一个开源模型、一个训练框架、一个代理工具链的团队,其实并不多。

smol.ai 当天聚合继续把 Qwen 团队离职余波列为高信号议题,说明社区并没有把这件事当八卦看完就散。原因很现实:开源世界需要的不只是“发布权重”,更是持续维护、版本节奏和组织稳定性。没有这些,今天再热闹的 repo,明天也可能变成无人善后的废墟。

今天的行业判断

如果把过去 24 小时压成一句话,那就是:AI 正从“模型发布驱动的新闻周期”,转向“基础设施、代理落地和部署经济学共同驱动的产品周期”

这意味着接下来一段时间,最值得跟踪的不一定是“谁又在某个 benchmark 上多了 2 分”,而是三类问题:

  • 模型价格还能被压到什么程度;
  • 代理能否真正嵌进网页、文档和业务系统,而不是只会跑 demo;
  • 低比特与边缘推理,能不能把 AI 的分发半径继续放大。

这三条线一旦同时成立,AI 行业接下来的胜负手就不只是“大模型谁最强”,而会变成“谁能把够强的模型,变成能铺开的能力”。这才是今天这些零散新闻背后,真正开始显形的东西。