LangChain Agent 实战:用工具调用与自主编排构建 LLM 驱动的智能体,从单工具调用到多智能体协作,含可运行代码与生产落地要点。
向量检索评测实战:用 Recall@K、MRR、NDCG 量化 RAG 检索质量,手把手搭建可回归评测集与向量库选型对比。
Ollama 能跑通但扛不住并发?本文用 vLLM 搭生产级推理服务:PagedAttention 与连续批处理原理、单卡多卡启动参数、显存与吞吐调优四板斧、OpenAI 兼容接口对接、压测方法与高频报错排查清单。
Ollama 模型管理不只是 ollama run 一行拉起。本文讲透 Modelfile 自定义、System Prompt 固化、模型构建与温度/上下文等关键推理参数调优,让本地大模型真正可控可用。
搭建 RAG 知识库,向量数据库怎么选?本文聚焦轻量级开源的 Chroma,实战演示安装、文本嵌入、相似度检索与存储选型对比,帮你用最小成本把文档变成可问答的向量库。
深入拆解大模型 Function Calling 工具调用机制:从 JSON Schema 函数声明、模型回传 tool_calls,到本地执行器与多轮编排,附 OpenAI 兼容接口与自建 Agent 的可运行示例。
从显存账算起,讲清 GGUF 单文件格式与量化命名规则,给出 llama.cpp 编译、F16 转换、Q4_K_M 量化、imatrix 校准、KV cache 量化到 llama-server 上线的完整可复制流程与调优参数速查。
大模型 RAG 不只靠向量检索。本文讲透混合检索(BM25+向量)与重排序 Rerank 的融合实战,附可落地的 Python 代码与 Recall@K 评估方法,显著提升知识库问答准确率。
想搭一个私有、不上云、能问答的 AI 知识库?本文用 Dify + Ollama 手把手完成本地部署,覆盖模型接入、知识库检索增强(RAG)与界面配置,数据留在自己机器上。
AI 编程工具该选哪个?本文从跨文件理解、重构能力、价格与本地部署四个维度,深度横评 GitHub Copilot、Cursor 与 Codeium,并给出不同团队规模下的组合使用建议。