AI 应用

语义缓存实战:用缓存给大模型应用降本提速

语义缓存实战:用缓存给大模型应用降本提速

语义缓存把意思相近的提问映射到同一答案,命中即返回:为大模型应用显著降本、提速并抗并发峰,本文附 Redis 与向量两种落地代码。

suzhe suzhe 2026-09-08
0 0 0
Prompt Caching 实战:用缓存降低 LLM 成本

Prompt Caching 实战:用缓存降低 LLM 成本

Prompt Caching 提示词缓存实战:用固定前缀缓存让 Claude、GPT 等大模型 API 成本大幅下降,附 Anthropic/OpenAI 落地代码与避坑清单。

suzhe suzhe 2026-09-07
0 0 0
GraphRAG 实战:用知识图谱增强 RAG 检索准确性

GraphRAG 实战:用知识图谱增强 RAG 检索准确性

GraphRAG 用知识图谱把文档拆成实体与关系,再以社区摘要实现全局问答。本文对比朴素 RAG 的差距,给出索引构建与局部/全局搜索的实战代码与落地建议。

suzhe suzhe 2026-09-04
0 0 0
LiteLLM 多模型网关:统一接入与成本路由

LiteLLM 多模型网关:统一接入与成本路由

接了多家大模型后代码越改越乱、成本算不清、一家挂全挂?LiteLLM 用一套接口统一 OpenAI/通义/Claude,自动路由、降级与成本归因。

suzhe suzhe 2026-09-03
0 0 0
Text2SQL 落地实战:自然语言转 SQL 与安全执行

Text2SQL 落地实战:自然语言转 SQL 与安全执行

Text2SQL 在 demo 里很惊艳,上生产就翻车。本文讲透落地全链路:Schema 提示怎么喂、几百张表如何向量召回、生成的 SQL 用 sqlglot 与 EXPLAIN 三道闸校验、只读账号与行数上限如何兜底,以及用执行结果比对做准确率评测。

suzhe suzhe 2026-09-02
0 0 0
模型蒸馏实战:知识蒸馏压缩大模型落地

模型蒸馏实战:知识蒸馏压缩大模型落地

模型蒸馏(知识蒸馏)用大模型的软标签训练小模型,在精度损失可控下大幅降低推理成本与延迟。本文从原理到代码跑通落地流水线。

suzhe suzhe 2026-09-01
0 0 0
LoRA 微调实战:从数据准备到模型合并部署

LoRA 微调实战:从数据准备到模型合并部署

LoRA 微调让消费级显卡也能定制专属大模型。本文讲透 LoRA 低秩原理、QLoRA 4bit 省显存方案、peft+TRL 训练代码、效果评估、适配器合并与 vLLM/Ollama 上线全流程,附超参与踩坑对照表。

suzhe suzhe 2026-09-01
0 0 0
多模态大模型应用落地:图文音视频理解与集成

多模态大模型应用落地:图文音视频理解与集成

多模态大模型让 AI 看懂图、听懂话、读懂视频:本文用 vLLM 视觉模型、Whisper 语音识别与 ffmpeg 抽帧,演示图文音视频理解与多模态 RAG 的工程落地。

suzhe suzhe 2026-08-30
0 0 0
Embedding 模型选型与文本向量化实战:RAG 检索质量基石

Embedding 模型选型与文本向量化实战:RAG 检索质量基石

Embedding 模型把文本映射为稠密向量,是 RAG 检索质量的地基。本文对比主流开源与商业模型,并给出文本向量化的工程实践与选型清单。

suzhe suzhe 2026-08-29
0 0 0
大模型结构化输出实战:JSON Schema 与提示工程

大模型结构化输出实战:JSON Schema 与提示工程

大模型结构化输出实战:用 JSON Schema 约束解码、Pydantic 校验与提示工程三层手段,让 LLM 稳定产出可直接落库的结构化数据。

suzhe suzhe 2026-08-27
0 0 0
1 2 3 4