同样的显卡、同样的模型,输出速度却能翻倍。推测解码用小模型抢跑、大模型批量验证,在数学上保证输出分布不变。本文讲清原理、四种路线选型、vLLM 落地配置与接受率调优。
当智能体从 demo 走向生产,单看演示已经不够。本文梳理 Agent 评测的两类范式与主流基准(SWE-bench/τ-bench/WebArena),给出可落地的自建四步法与最小评测骨架,并拆解数据污染、奖励黑客等五大陷阱。
SFT 只教格式,对齐才教好坏。本文拆解 RLHF 与 DPO 两条偏好对齐路线:偏好数据构造与清洗、TRL DPOTrainer 训练脚本、奖励模型与 PPO 取舍、成对胜率评测与七个高频坑。
上下文工程(Context Engineering)决定大模型能否用好长上下文:本文拆解 system/user/few-shot/memory 四构件,给出 RAG 组装、裁剪压缩与常见反模式的实战写法,避免把 token 浪费在噪音上。
大模型提示注入是 RAG 与 Agent 的重灾区。本文拆解直接/间接注入三类攻击手法,给出输入加固、工具权限最小化、输出校验三层防御与红队清单。
讲清推理模型的 test-time compute 与思维链原理,拆解 PRM 与 RLVR 训练路线,并给出 reasoning_effort 调参、多轮工具调用的坑与快慢双模型路由的落地做法。
MoE 混合专家通过路由网络只激活少数专家,让参数规模暴增而推理算力近似线性增长。本文讲清原理、训练技巧与部署要点,并给出工程选型建议。
端侧大模型部署实战:用量化与轻量推理框架把 LLM 搬进手机与边缘设备,2026 年低延迟、隐私优先的边缘推理落地指南。