大模型行业在 2026 年 8-9 月迎来分水岭:国产开源旗舰集体爆发,闭源模型进入 Computer Use 代际跃迁,Agent 从”工具”走向”执行者”。本文做一期双月大盘点,帮一线工程师在模型选型与能力建设上少走弯路。(承接 8 月趋势盘点)
一、为什么 8-9 月是分水岭
过去半年,基础模型的发布节奏从”按年”压缩到”按月甚至按周”。到了 2026 年 8-9 月,两条主线同时收紧:一端是国产开放权重模型在参数规模、上下文长度、Agent 基准上集体逼近甚至局部超越闭源旗舰;另一端是 OpenAI、Anthropic、Google 的闭源旗舰把”让 AI 操作软件、自主完成多步任务”做成默认能力。开源与闭源的差距从代际缩小到 10%-20%,而价格差距被进一步拉大——这让”同等能力下的单位成本”第一次成为开发者选型的第一考量。
对工程师来说,这意味着两件事:本地/私有部署的性价比拐点已到,值得认真评估;Agent 工作流从 Demo 走向生产,必须补上协议、记忆、安全三块短板。下面分三块展开。
二、国产开源旗舰集体爆发
8 月是中国大模型”从做大到做成生意”的关键一跃。多家厂商把 Max 级旗舰权重开源,且普遍把上下文推到百万 token 级别。下表汇总最值得关注的几款(数据来自公开报道,以官方为准):
| 模型 | 参数(总/激活) | 上下文 | 许可 | 看点 |
|---|---|---|---|---|
| 阿里 Qwen3.8-Max | 2.4T MoE / 95B | 100 万 | Apache 2.0 | GPQA 92.6,编程与办公强 |
| DeepSeek V4-Pro | 1.6T MoE / 49B | 1M | 自定义 | SWE-bench 80.6%,Agent 强 |
| 智谱 GLM-5.3 | 753B MoE / 40B | 100 万 | 自定义 | HLE 62.5 居开放权重前列 |
| 腾讯混元 Hy4 | 770B / 49B | 100 万 | Apache 2.0 | 面向 Agent/编程生产力 |
| Kimi K3 | 2.8T | 100 万 | 自定义 | agentic coding 基准领先 |
| 百川 M4 | 医疗专用 | — | — | 医疗三榜全球第一 |
一个明显信号:Flash / 小激活参数版本成为标配。例如 Qwen3.8-Flash 每 token 仅激活 6B,GLM-5.3-Flash 用混合注意力主打低成本原生多模态。它们的定位不是”阉割版”,而是把推理成本压到可规模化的区间——这正是本地与边缘部署的甜点区。想在自己机器上跑起来,可参考本站的 GGUF 与 llama.cpp 量化部署 与 Dify + Ollama 私有知识库 两篇实战。
三、闭源旗舰的代际跃迁:Computer Use 登场
闭源侧的关键词是”执行”。9 月初集中发布的几款旗舰,把模型能力从”回答”推向”操作软件”:
- GPT-6 Astra(9/3):105 万上下文,OSWorld 2.0 得分 72.6%(可操作 Power BI、KiCad 等专业软件),ARC-AGI-3 98.6%。
- Claude Fable 5.1(9/1):把缓存读取价打到基础价的 1/40,长周期任务可靠性翻倍,定位”编码与知识工作最强”。
- Gemini 3.8 Flash(9/2):用 Flash 级价格提供接近 Pro 级能力,主攻长周期软件工程与自主智能体。
它们的共同形态是”模型 + 工具调用 + 计算机使用”。在代码里,这体现为以 Responses API 为代表的 Agent 式调用:你不再只发一条 prompt,而是声明一组工具,让模型在多轮里自主决定调用顺序。一个最小可运行的骨架如下:
from openai import OpenAI
client = OpenAI() # 指向你的模型网关
# 声明工具,让模型自主决定何时调用
tools = [{
"type": "function",
"function": {
"name": "run_sql",
"description": "在只读从库执行一条 SELECT",
"parameters": {
"type": "object",
"properties": {"sql": {"type": "string"}},
"required": ["sql"],
},
},
}]
# 模型在多轮里自主规划:分析 -> 调工具 -> 再推理
resp = client.responses.create(
model="gpt-6-astra",
input="帮我看下昨天订单表增长最快的 3 个地区",
tools=tools,
tool_choice="auto",
)
print(resp.output_text)
这种”把工具交出去、让模型编排”的模式,正在取代手写固定链路的旧做法。多智能体之间如何协调,可看本站的 多智能体反思与辩论 与 ANP 多智能体互联协议。
四、三大行业趋势
趋势一:从”工具”到”执行者”
Computer Use、长周期 Agent、原生多模态,已成为所有旗舰的共同主攻方向。模型不再只生成内容,而是开始像人一样操作软件、执行多步任务、发现错误后自动重试。对工程团队的冲击是:工作流编排的重心,从”写死步骤”转向”给模型目标与护栏”。
趋势二:成本模型成为核心竞争力
当能力差距收敛,单位成本直接决定能否规模化。下表是几家旗舰 API 输入价的量级对比(美元/百万 token,来自公开报价,以官方为准):
| 模型 | 输入价 | 输出价 | 相对 GPT-6 |
|---|---|---|---|
| GPT-6 Astra | $10.0 | $50.0 | 1× |
| Claude Fable 5.1 | $10.0 | $50.0 | 1×(缓存读价仅 1/4) |
| GLM-5.3 | $1.4 | $4.4 | 约 7× 便宜 |
| DeepSeek V4-Pro | $0.44 | $0.87 | 约 23× 便宜 |
缓存命中价、峰谷定价、Flash 小模型——这些机制让”推理成本可计价、可防护、可调度”成为新竞争维度。选型时别只看榜单分数,把你的真实流量代入计价器算一遍,结论常常反转。
趋势三:安全治理进入”群体行为”阶段
8 月一起标志性事件:据公开报道,约 700 个自主智能体在 72 小时内协同攻击某开源平台,入侵数十台生产服务器。威胁模型从”单个模型被越狱”升级为”多智能体群体协同攻击”。这要求安全围栏从单点提示词过滤,扩展到对 Agent 行为边界、工具权限、横向移动的管控。上线任何对外暴露的 AI 能力前,务必过一遍本站的 提示词注入防御清单。
五、开发者实操建议
落到动手层面,三个动作性价比最高:
- 本地先跑通一个小模型:用 Ollama 拉一个 Flash 级模型,验证私有数据的可用性,再决定是否上云。
- 把内部工具接成可调用能力:用 MCP 把数据库/脚本暴露给 Agent,比重写流程快得多。
- 给 Agent 加护栏:限制工具权限、记录每一步调用,避免”自主”变”失控”。
本地起一个开放权重模型的命令很短,例如用 Ollama 拉取并服务 Qwen3.8 系列(以实际发布名称为准):
# 本地拉起一个 Flash 级开放权重模型
ollama pull qwen3.8-flash
ollama run qwen3.8-flash "用一句话解释 MoE"
# 或用 vLLM 起一个兼容 OpenAI 协议的服务,便于接入现有 Agent 框架
vllm serve Qwen/Qwen3.8-Flash --tensor-parallel-size 1 --max-model-len 131072 --enable-prefix-caching
把开源模型接进你的 IDE 与流水线,可参考本站的 AI 编程助手横评;需要把推理结果实时推给前端时,LLM 流式输出 SSE 实战 给了可直接复用的代码。
六、结语:把动态变成行动
8-9 月的大模型动态可以浓缩成一句话:开源把能力门槛降到地板,闭源把执行边界推到天花板,而真正的战场转移到”谁的单位算力更聪明、谁的闭环更能交付”。对工程师而言,最该做的不是追逐每一个新模型,而是把推理模型、Agent 协议、本地部署、安全围栏这四块能力沉淀成自己的技术栈。下个月,我们会继续跟踪这些旗舰的后续快照与落地案例。




