今日结论
- 模型竞争转向“任务经济性”。 Anthropic 用 Fable 5.1 的缓存降价和默认分发争夺 Agent 工作负载,但独立预发布测试显示更长输出可能抵消单价优势;迁移决策应看单任务总成本,而非价目表。
- 网络能力跨过更高安全门槛。 OpenAI 将未发布的 Astra 定为首个达到其“Critical”网络能力等级的模型;能力与防护数字均为公司自评,正式 system card 和外部复现仍是关键证据。
- AI 基础设施需求继续兑现为收入,也积成履约风险。 Dell 单季确认 164 亿美元 AI 服务器收入、期末积压 950 亿美元;供应链应同时看交付、库存、现金流和客户集中度。
- AI 正进入高责任工作流与正式控制面。 Epic 病历只读接入、Copilot 可计入合并批准、欧盟首批执法问询同时出现;“能接入”已不等于“可放权”,审计、独立复核与最小权限成为上线前提。
重点动态
Claude Fable / Mythos 5.1 上线,缓存价大降|模型 / Coding / 推理。 Fable 5.1 已全面可用并成为 Claude Code 默认 Fable,也进入 GitHub Copilot;Mythos 5.1 只向受信计划开放。定价为每百万输入/输出 token 10/50 美元,缓存读取 0.25 美元、下降 75%。Anthropic 估算典型负载约省 25%、高度 Agent 化负载最高约省 45%,属于公司主张;Artificial Analysis 的预发布测试反而测得单任务 3.76 美元、比 Fable 5 高约 20%,主因是输出更长。**行动:**用真实代码任务重跑质量、拒答、缓存命中和总账单,并核对默认 30 天数据保留。Anthropic,9 月 1 日 · 独立测试 · Copilot 分发
OpenAI 预告 Astra 达到“Critical”网络能力|模型 / 训练 / 安全。 Astra 尚未上线,先进网络能力首批将限于受信访问。OpenAI 自评其 ExploitBench 为 100%,并在 20 个高危 V8 漏洞的内部集合中找到、串联两个零日;拒答评测为 91.5%,对比 GPT-5.6 Sol 的 59%。这些数字尚无独立核验,部分训练实验也仍受暂停控制。**行动:**安全团队现在只准备隔离环境、审批链和蜜罐基线,不预设可用性;等待正式 system card、默认配置与第三方复现。OpenAI,9 月 1 日 · TechCrunch 核验边界
Dell 的 AI 服务器积压升至 950 亿美元|Infra / 商业。 Dell 向 SEC 披露第二财季总营收 470 亿美元、同比增 58%;AI 服务器订单 609 亿美元、收入 164 亿美元,并把全年 AI 服务器收入指引从 600 亿上调至 740 亿美元。已确认收入是需求兑现的硬信号,但订单、积压和指引仍是公司口径,积压不等于不可取消的收入。**行动:**上游厂商优先跟踪积压转收入速度、毛利、库存与供电交付,而不是只外推订单峰值。Dell SEC 8-K 附件,9 月 1 日
欧盟确认向 30 多家 AI 公司发出首批执法问询|政策与商业。 欧委会 9 月 1 日记者会确认,首批 request for information 分安全保障、版权透明度两条线,现阶段是问询,不是违规认定;收件公司也未公开。AI Office 可进一步要求模型访问、整改,并对 GPAI 义务违规处以最高 1500 万欧元或全球年营收 3%的罚款。**行动:**供应商应冻结并可追溯保存评测、事件日志、训练数据摘要和版权政策;下游只询问合规状态,不猜测收件人。欧委会记者会,9 月 1 日 · 执法框架
ChatGPT for Healthcare 接入 Epic 与九个公共数据源|应用。 新连接器只读授权病历并回链原始图表;公共数据插件覆盖 PubMed、ClinicalTrials.gov、CMS、RxNorm、DailyMed 等九个官方源。OpenAI 自评 4,363 次医生评分中 99.1%“安全”、受测数据源准确性逾 93%,但这不是独立临床结局验证。**行动:**只在适用 BAA、管理员授权和原有 Epic 权限内试点,保留引用核对、抽样医师复审,禁止自动回写。OpenAI,9 月 1 日 · TechCrunch
Copilot 评审可正式批准 PR|Coding / 治理。 GitHub 在公开预览中允许管理员启用 Copilot approval,并让其计入仓库 required approvals;功能默认关闭,可限制文件路径,新提交会撤销旧批准。它把 AI 从“建议者”推入合并控制面,但官方未提供审查准确率。**行动:**不要让同一 Agent 同时写代码并成为唯一批准者;保留独立人工或异构模型复核、CI 与敏感路径 CODEOWNERS 门禁。GitHub,9 月 1 日
值得深入跟踪
- Anthropic–Lambda 算力交易。 英文媒体援引匿名信源称双方签署六年、350 亿美元、约 350MW 的协议,但公司均未正式确认。观察正式公告、take-or-pay 条款、担保、租约传导与首次通电;此前不要把金额当作已验证收入。Reuters 转引
- California SB 1119。 “Adam’s Law”已于 8 月 31 日获州议会通过,属7 天持续影响,仍待州长签署;若生效,将引入年龄保障、发布前风险评估、家长通知、默认记忆限制和独立审计。观察签署、实施细则与诉讼边界。加州参议员公告
- 监管与临床结果是否跟上产品发布。 观察欧盟问询是否转为正式决定、Astra 是否发布完整安全材料,以及 Epic 试点能否披露引用错误率、复核负担和真实时间节省;这三类后续证据比发布日自评分更能决定采购。
今日推荐
- 试用 Hugging Face WebGPU Kernels。 207 个 Apache-2.0 kernel 和浏览器 Fleet 基准适合本地推理团队做跨设备验证;官方 M4 的 2.57×几何均值只计 GPU 操作,不是整模端到端承诺。
- A/B 测试 Gemini Agentic Video。 已面向 Gemini 3.7/3.6/3.5 Flash 系列开放;“最高少 88% token、低 66%成本、准确率高 7%”均为 Google 自测,应以自有长视频的漏检率和总费用验收。
- 审计 Perplexity Hybrid Compute on Mac。 它以本地 Privacy Gate 分流私密数据与云推理,要求 Apple silicon、macOS 15+、至少 24GB 内存;敏感行业应先红队测试分类器假阴性,再谈生产使用。