今日导读
今天的AI领域有两个核心事件并行展开。
第一条线是技术能力的突破。OpenAI正式发布GPT-5.4,这是其首个具备原生计算机使用能力的前沿模型,在OSWorld-Verified基准上达到75%成功率,首次超越人类水平的72.4%。这意味着AI Agent从”对话”迈向”操作”的关键一步。
第二条线是伦理争议的升级。Anthropic被美国国防部正式列为”供应链风险”,面临被踢出联邦系统的命运。这场始于上周的OpenAI国防部合作争议,正在演变为整个AI行业的制度性挑战。
重点 TOP5
1. GPT-5.4 发布:首个原生计算机使用模型
核心事实:
- GPT-5.4是OpenAI首个具备原生计算机使用能力的前沿模型,支持通过截图和键盘鼠标操作完成复杂工作流
- 在OSWorld-Verified基准上达到75%成功率,超越人类水平的72.4%
- 在SWE-Bench Pro上达到57.7%,显著领先GPT-5.2的55.6%
- 支持最高100万token上下文,引入”upfront plan”机制让用户可以在模型思考过程中调整方向
- 在知识工作基准GDPval上,GPT-5.4在83%的任务中匹配或超越行业专业人士
为什么重要: 计算机使用能力是AI Agent的核心瓶颈。之前模型需要通过API调用来操作计算机,而GPT-5.4可以直接”看”屏幕并执行操作。这标志着AI从”被动的工具”向”主动的执行者”转变。
2. Anthropic 被国防部列为”供应链风险”
核心事实:
- 3月4日,Anthropic收到国防部信函,被指定为对美国国家安全的供应链风险
- 这是依据10 USC 3252法案采取的行动,Anthropic表示将诉诸法律挑战这一决定
- 国防部的指定范围实际上很窄,仅适用于直接参与国防部合同的情况
- Dario Amodei公开道歉,承认之前内部备忘录的”语气不当”
为什么重要: 这是AI公司首次被政府以”国家安全”名义制裁。Anthropic与OpenAI的路线分歧不再是价值观辩论,而是变成了真正的制度性对抗。
3. OpenAI 与国防部交易的争议持续
核心事实:
- 上周 Pentagon 宣布与 OpenAI 达成合作协议
- 该宣布最初连 OpenAI 自身都描述为”confusing”(令人困惑)
- Dario Amodei 曾在内部备忘录中称 OpenAI 的说辞是”彻头彻尾的谎言”
为什么重要: 这场争议揭示了AI公司与军事机构合作的核心困境——即便合同条款存在,实际执行中的透明度和技术控制力都难以保证。
4. Anthropic 发布AI劳动力市场影响研究
核心事实:
- 提出新衡量指标”observed exposure”,结合理论LLM能力和实际使用数据
- 发现AI远远未达到其理论能力上限,实际覆盖率仍是一小部分
- 尚未发现暴露度高的工人出现系统性失业,但有迹象表明年轻工人的招聘放缓
- 高暴露职业的从业者特征:年龄偏大、女性、学历更高、收入更高
为什么重要: 这是AI公司首次用自身数据来研究劳动力市场影响。结论出人意料地温和——至少到目前为止,AI还没有导致大规模失业。
5. AI 模型事实准确性持续提升
核心事实:
- GPT-5.4是OpenAI”最事实准确”的模型
- 相比GPT-5.2,GPT-5.4的个体声明出错率降低33%,完整响应包含错误的可能性降低18%
趋势小结
- Agent 技术进入临界点: GPT-5.4的计算机使用能力标志着AI Agent从概念验证走向实用
- AI 伦理争议制度化: Anthropic vs 国防部不再是公司间口水战,而是上升到法律层面
- 劳动力影响仍待观察: Anthropic的研究给出了相对温和的早期证据,但长期影响仍不确定