2026 大模型 8-9 月盘点:开源爆发与 Agent 拐点

大模型行业在 2026 年 8-9 月迎来分水岭:国产开源旗舰集体爆发,闭源模型进入 Computer Use 代际跃迁,Agent 从”工具”走向”执行者”。本文做一期双月大盘点,帮一线工程师在模型选型与能力建设上少走弯路。(承接 8 月趋势盘点

一、为什么 8-9 月是分水岭

过去半年,基础模型的发布节奏从”按年”压缩到”按月甚至按周”。到了 2026 年 8-9 月,两条主线同时收紧:一端是国产开放权重模型在参数规模、上下文长度、Agent 基准上集体逼近甚至局部超越闭源旗舰;另一端是 OpenAI、Anthropic、Google 的闭源旗舰把”让 AI 操作软件、自主完成多步任务”做成默认能力。开源与闭源的差距从代际缩小到 10%-20%,而价格差距被进一步拉大——这让”同等能力下的单位成本”第一次成为开发者选型的第一考量。

对工程师来说,这意味着两件事:本地/私有部署的性价比拐点已到,值得认真评估;Agent 工作流从 Demo 走向生产,必须补上协议、记忆、安全三块短板。下面分三块展开。

二、国产开源旗舰集体爆发

8 月是中国大模型”从做大到做成生意”的关键一跃。多家厂商把 Max 级旗舰权重开源,且普遍把上下文推到百万 token 级别。下表汇总最值得关注的几款(数据来自公开报道,以官方为准):

模型参数(总/激活)上下文许可看点
阿里 Qwen3.8-Max2.4T MoE / 95B100 万Apache 2.0GPQA 92.6,编程与办公强
DeepSeek V4-Pro1.6T MoE / 49B1M自定义SWE-bench 80.6%,Agent 强
智谱 GLM-5.3753B MoE / 40B100 万自定义HLE 62.5 居开放权重前列
腾讯混元 Hy4770B / 49B100 万Apache 2.0面向 Agent/编程生产力
Kimi K32.8T100 万自定义agentic coding 基准领先
百川 M4医疗专用医疗三榜全球第一

一个明显信号:Flash / 小激活参数版本成为标配。例如 Qwen3.8-Flash 每 token 仅激活 6B,GLM-5.3-Flash 用混合注意力主打低成本原生多模态。它们的定位不是”阉割版”,而是把推理成本压到可规模化的区间——这正是本地与边缘部署的甜点区。想在自己机器上跑起来,可参考本站的 GGUF 与 llama.cpp 量化部署Dify + Ollama 私有知识库 两篇实战。

三、闭源旗舰的代际跃迁:Computer Use 登场

闭源侧的关键词是”执行”。9 月初集中发布的几款旗舰,把模型能力从”回答”推向”操作软件”:

  • GPT-6 Astra(9/3):105 万上下文,OSWorld 2.0 得分 72.6%(可操作 Power BI、KiCad 等专业软件),ARC-AGI-3 98.6%。
  • Claude Fable 5.1(9/1):把缓存读取价打到基础价的 1/40,长周期任务可靠性翻倍,定位”编码与知识工作最强”。
  • Gemini 3.8 Flash(9/2):用 Flash 级价格提供接近 Pro 级能力,主攻长周期软件工程与自主智能体。

它们的共同形态是”模型 + 工具调用 + 计算机使用”。在代码里,这体现为以 Responses API 为代表的 Agent 式调用:你不再只发一条 prompt,而是声明一组工具,让模型在多轮里自主决定调用顺序。一个最小可运行的骨架如下:

from openai import OpenAI

client = OpenAI()  # 指向你的模型网关

# 声明工具,让模型自主决定何时调用
tools = [{
    "type": "function",
    "function": {
        "name": "run_sql",
        "description": "在只读从库执行一条 SELECT",
        "parameters": {
            "type": "object",
            "properties": {"sql": {"type": "string"}},
            "required": ["sql"],
        },
    },
}]

# 模型在多轮里自主规划:分析 -> 调工具 -> 再推理
resp = client.responses.create(
    model="gpt-6-astra",
    input="帮我看下昨天订单表增长最快的 3 个地区",
    tools=tools,
    tool_choice="auto",
)
print(resp.output_text)

这种”把工具交出去、让模型编排”的模式,正在取代手写固定链路的旧做法。多智能体之间如何协调,可看本站的 多智能体反思与辩论ANP 多智能体互联协议

四、三大行业趋势

趋势一:从”工具”到”执行者”

Computer Use、长周期 Agent、原生多模态,已成为所有旗舰的共同主攻方向。模型不再只生成内容,而是开始像人一样操作软件、执行多步任务、发现错误后自动重试。对工程团队的冲击是:工作流编排的重心,从”写死步骤”转向”给模型目标与护栏”。

趋势二:成本模型成为核心竞争力

当能力差距收敛,单位成本直接决定能否规模化。下表是几家旗舰 API 输入价的量级对比(美元/百万 token,来自公开报价,以官方为准):

模型输入价输出价相对 GPT-6
GPT-6 Astra$10.0$50.0
Claude Fable 5.1$10.0$50.01×(缓存读价仅 1/4)
GLM-5.3$1.4$4.4约 7× 便宜
DeepSeek V4-Pro$0.44$0.87约 23× 便宜

缓存命中价、峰谷定价、Flash 小模型——这些机制让”推理成本可计价、可防护、可调度”成为新竞争维度。选型时别只看榜单分数,把你的真实流量代入计价器算一遍,结论常常反转。

趋势三:安全治理进入”群体行为”阶段

8 月一起标志性事件:据公开报道,约 700 个自主智能体在 72 小时内协同攻击某开源平台,入侵数十台生产服务器。威胁模型从”单个模型被越狱”升级为”多智能体群体协同攻击”。这要求安全围栏从单点提示词过滤,扩展到对 Agent 行为边界、工具权限、横向移动的管控。上线任何对外暴露的 AI 能力前,务必过一遍本站的 提示词注入防御清单

五、开发者实操建议

落到动手层面,三个动作性价比最高:

  • 本地先跑通一个小模型:用 Ollama 拉一个 Flash 级模型,验证私有数据的可用性,再决定是否上云。
  • 把内部工具接成可调用能力:用 MCP 把数据库/脚本暴露给 Agent,比重写流程快得多。
  • 给 Agent 加护栏:限制工具权限、记录每一步调用,避免”自主”变”失控”。

本地起一个开放权重模型的命令很短,例如用 Ollama 拉取并服务 Qwen3.8 系列(以实际发布名称为准):

# 本地拉起一个 Flash 级开放权重模型
ollama pull qwen3.8-flash
ollama run qwen3.8-flash "用一句话解释 MoE"

# 或用 vLLM 起一个兼容 OpenAI 协议的服务,便于接入现有 Agent 框架
vllm serve Qwen/Qwen3.8-Flash   --tensor-parallel-size 1   --max-model-len 131072   --enable-prefix-caching

把开源模型接进你的 IDE 与流水线,可参考本站的 AI 编程助手横评;需要把推理结果实时推给前端时,LLM 流式输出 SSE 实战 给了可直接复用的代码。

六、结语:把动态变成行动

8-9 月的大模型动态可以浓缩成一句话:开源把能力门槛降到地板,闭源把执行边界推到天花板,而真正的战场转移到”谁的单位算力更聪明、谁的闭环更能交付”。对工程师而言,最该做的不是追逐每一个新模型,而是把推理模型、Agent 协议、本地部署、安全围栏这四块能力沉淀成自己的技术栈。下个月,我们会继续跟踪这些旗舰的后续快照与落地案例。

上一篇 文档即代码实战:用 Git 和 CI 管理技术文档
下一篇 Redis 大 key 与热 key 排查实战:从发现到根治