Skip to content

今日结论

  • 开权重模型在同一天把竞争推向“稀疏激活、长上下文与多模态”的组合效率。 GLM-5.3-Flash 已有第三方价格、速度与能力测量;Qwen3.8-Flash-Next 更像 Qwen4 的架构预览,其训练成本和基准仍待复现。选型应从榜单转向自有代码、图像和长上下文负载。
  • Agent 正从聊天框变成浏览器与 IDE 的执行层。 Claude in Chrome 放开到全部付费计划,VS Code 可接续外部 Agent 会话并让第二模型复核;便利性上升的同时,提示注入、域名权限和默认沙箱状态成为上线门槛。
  • 算力扩张的量级继续上移,但“宣布”不等于“可用”。 AWS 与 NVIDIA 计划在 2027–2028 年新增部署 200 万颗 GPU;在区域、供电、采购金额和交付节奏披露前,它是强需求信号,不是当期容量。
  • Agent 采购开始进入 FinOps 阶段。 Google 同时引入按量计费、承诺折扣、月度上限和异常检测,说明企业竞争点正从“能否调用 Agent”转向“能否预测、归因并约束每次执行成本”。

重点动态

1. AWS 与 NVIDIA 规划新增 200 万颗 GPU

领域:Infra|24 小时。 事实: 双方宣布 AWS 将在 2027–2028 年部署 200 万颗 Blackwell Ultra、Rubin 与 Rubin Ultra GPU,并另建面向美国政府工作负载的 10 万颗 GPU 安全基础设施;Vera CPU、NVLink Fusion 与未来 NVHBM 也进入合作路线。Reuters 于 8 月 26 日 20:25 UTC 报道,落在严格窗口内。影响与判断: 这是云端算力采购规模再上台阶的信号,也会牵动 HBM、网络、冷却与电力链;但采购金额、机房区域、MW、正式合同和分批交付均未披露,不能写成已上线容量。行动: 只按路线图规划,等待实例可订购、区域和供电里程碑。AWS 官方公告(2026-08-26);Reuters 报道(2026-08-26)。

2. GLM-5.3-Flash 把独立测得的开权重性价比再压低

领域:模型 / 训练 / 推理|24 小时,官方仅给日期,时间边界不确定。 事实: Z.ai 发布 MIT 许可的 320B 总参数、18B 激活参数多模态模型,支持 100 万上下文;官方披露采用混合线性与稀疏注意力、30T token 多模态预训练。Artificial Analysis 独立测得 Intelligence Index 57、输出 48.7 token/s,API 价为每百万输入/输出 token 0.15/0.50 美元,同时指出速度偏慢、输出偏冗长。公司主张: “较 GLM-5.2 低至十分之一价格”和国产芯片集群收益尚无独立核验。行动: 用真实 Agent/编码任务同时测质量、尾延迟、输出长度和总成本。模型卡独立测量(2026-08-26)。

3. Qwen3.8-Flash-Next 提前开放 Qwen4 架构预览

领域:模型 / 训练 / 推理|24 小时,官方仅给日期,时间边界不确定。 事实: 该开放权重多模态 MoE 含 125B 主模型、51B n-gram embedding,每 token 激活 6B 参数,原生上下文 262k;QSA 微块稀疏注意力、Gated Residual、n-gram embedding 和 Muon 优化器共同指向更低的长上下文计算与训练稳定性,SGLang、vLLM、Transformers 已给出部署路径。公司主张: 训练成本约为 Qwen3.7-Plus 的九分之一及编码/办公基准优势均未独立复现。影响与判断: 真正价值是社区可提前验证下一代架构,而非厂商榜单名次。行动: 先验证新算子兼容、显存、长序列吞吐和工具调用稳定性。官方仓库模型权重(2026-08-26)。

4. Claude in Chrome 全面 GA,浏览器成为高权限 Agent 执行面

领域:应用|24 小时,官方仅给日期,时间边界不确定。 事实: 所有 Claude 付费计划现可让 Agent 利用既有登录跨标签页点击、输入、导航和填表,不再逐动作确认;每个动作经安全分类器检查,管理员可限制域名。公司自评: 加入 probes 与分类器后,多款内部模型未出现成功攻击、Fable 5 为 0.3%,但没有独立复现;官方安全指南仍称浏览器 Agent 存在固有风险,并不建议用于金融、法律、医疗或敏感企业数据。影响与判断: 产品可用性跨过门槛,安全性尚未跨过。行动: 使用隔离浏览器资料夹、最小域名白名单和低风险任务,保留人工复核。发布说明安全指南(2026-08-26)。

5. Google 为企业 Agent 加入按量计费与成本护栏

领域:应用 / Coding / 政策与商业|24 小时,官方仅给日期,时间边界不确定。 事实: Gemini Enterprise 面向部分客户推出 PAYG,可与席位计费混用;一年、三年 Flexible Savings Plans 分别折扣 10% 与 20%,并提供月度上限、运行前成本估算和异常支出定位。边界: PAYG 与 Antigravity、Android Studio 合并额度仍在滚动开放;延迟执行工作负载“最高减半”是 coming soon,不是现行普遍价格。影响与判断: Agent 的单位经济性开始被产品化管理。行动: 先核对客户资格、标准 API 基准价、达到上限后的暂停语义及成本归因粒度。Google Cloud 官方说明(2026-08-26)。

6. VS Code 1.135 接续外部 Agent 会话,但默认沙箱回退

领域:Coding|24 小时;发布于 2026-08-26 16:52 UTC。 事实: VS Code 可显示并继续来自 Copilot 或 Claude 的近期外部会话;实验性 /rubber-duck 可调用互补模型做二次审查,并按模型拆分输入、缓存输入和输出 token。更关键的是,本地 agent harness 的沙箱默认 rollout 从 50% 调回 0%,仍仅供用户主动开启;官方称未发现具体阻断问题,回退是为集中投入其他优先项。影响与判断: 跨工具会话和多模型复核已进入主流 IDE,但不能把“本地 Agent”误认为“默认隔离”。行动: 升级后显式检查沙箱与模型费用,再纳入团队基线。Release完整说明(2026-08-26)。

值得深入跟踪

  1. 两款新开权重模型的生产曲线。 观察第三方代码/视觉/百万上下文测试、真实并发成本,以及 vLLM/SGLang 对新稀疏算子的稳定支持;公司平均基准不能替代尾延迟和总 token 成本。
  2. 两百万 GPU 路线图的执行证据。 需要看到 AWS 区域、实例 SKU、MW、供电与并网、采购金额和分批交付;任何一项缺失都会把“需求承诺”与“可售容量”拉开。
  3. Agent 治理是否追上执行权限。 关注 Claude 浏览器代理的真实提示注入事件、VS Code 沙箱恢复默认 rollout,以及 Debian LLM 使用决议 在 8 月 28 日截止后的结果和其他开源项目跟进。

今日推荐

  1. 试用 vLLM 0.28.0(2026-08-26)。 Kimi-K3、DeepSeek-V4、推测解码、分层 KV offload 与 Rust/gRPC 前端同时推进;但 Transformers 5.15、bitsandbytes 外移等破坏性变化要求先做隔离回归和负载基准。
  2. 阅读 Quantization-Aware Healing(2026-08-21,7 天持续影响)。 方法用原始未压缩 teacher 修复结构压缩后的 4-bit student;“7/9 基准持平或更好”主要对比恢复出的 60B BF16 checkpoint,公开模型还接受额外训练,尚无独立复现。
  3. ECB 的生成式 AI 劳动力调查(2026-08-26)作为采用率基线。 约两万人的月度样本显示自报使用率升至 52%、用户每周中位节省 3 小时;这是自报效率而非因果生产率,适合校准企业 ROI 假设,不适合直接外推。