踩坑记录

DNS 解析故障排查实战:从 dig 到缓存与劫持定位

DNS 解析故障排查实战:从 dig 到缓存与劫持定位

网站域名打不开但 IP 能通?复盘一次 DNS 解析故障,用 dig 定位解析失败/变慢、缓存污染与劫持,附六步排查清单。

suzhe suzhe 2026-09-08
0 0 0
连接池耗尽与端口耗尽排查:从 TIME_WAIT 到连接泄漏根治

连接池耗尽与端口耗尽排查:从 TIME_WAIT 到连接泄漏根治

连接池耗尽与端口耗尽是两种常被混淆的线上故障。本文用真实排错命令与 HikariCP、Redis、sysctl 配置示例,带你从 TIME_WAIT 暴涨快速定位到连接泄漏根因并给出根治方案。

suzhe suzhe 2026-09-08
0 0 0
Cilium 实战:用 eBPF 数据面替代 kube-proxy 踩坑记

Cilium 实战:用 eBPF 数据面替代 kube-proxy 踩坑记

从 kube-proxy 迁移到 Cilium eBPF 数据面,复盘 DNS 解析失败、ClusterIP 不通、Hubble 观测缺失三起真实踩坑,附排查命令与回滚方案。

suzhe suzhe 2026-09-07
0 0 0
磁盘 IO 被打满:一次写入阻塞导致接口雪崩的排查实录

磁盘 IO 被打满:一次写入阻塞导致接口雪崩的排查实录

磁盘 IO 被打满会让接口在 CPU 闲时突然雪崩。本文用 iostat/iotop/pidstat 定位狂写进程,归纳五类根因,给出 ionice 止血与 logrotate、异步化等根治方案,并复盘一次真实事故。

suzhe suzhe 2026-09-07
0 0 0
缓存与数据库一致性实战:延迟双删与 binlog 订阅

缓存与数据库一致性实战:延迟双删与 binlog 订阅

缓存与数据库一致性怎么保证?对比延迟双删、Cache-Aside 与订阅 binlog 三种方案,复盘生产环境常见的删缓存失败与旧值回填踩坑,并给出按场景选型建议。

suzhe suzhe 2026-09-06
0 0 0
接口幂等设计:防重复提交与分布式去重实战

接口幂等设计:防重复提交与分布式去重实战

接口幂等性设计实战:用防重 Token、数据库唯一索引与 Redis 分布式锁解决重复提交与重复支付,附 6 种方案与可运行代码。

suzhe suzhe 2026-09-05
0 0 0
Graceful Shutdown:优雅停机与无损下线

Graceful Shutdown:优雅停机与无损下线

Graceful Shutdown(优雅停机)是发布与扩缩容时避免事故的关键:先摘流量、再处理在途请求、最后退出进程。本文从进程信号讲到 Spring Boot 与 K8s 的配合,给出可直接套用的无损下线配置清单。

suzhe suzhe 2026-09-05
0 0 0
MySQL 字符集与时区踩坑:乱码与时间差 8 小时

MySQL 字符集与时区踩坑:乱码与时间差 8 小时

MySQL 字符集与时区踩坑复盘:emoji 写入报错、数据读出乱码、报表时间差 8 小时。按 server/库/表/列四层继承与 OS/MySQL/会话/驱动三层时区逐级定位,附 utf8mb4 转换、collation 统一、容器时区配置与上线 Checklist。

suzhe suzhe 2026-09-03
0 0 0
Kafka 消息积压与重复消费排查实录

Kafka 消息积压与重复消费排查实录

线上 Kafka 积压导致订单延迟?本文复盘一次真实事故:从 consumer lag 定位根因、临时扩容止血,到用幂等消费与死信队列根治重复消费,附六步排查清单与 Prometheus 告警规则。

suzhe suzhe 2026-09-02
0 0 0
磁盘 I/O 打满导致服务雪崩:一次 IO 瓶颈排查实录

磁盘 I/O 打满导致服务雪崩:一次 IO 瓶颈排查实录

核心接口 P99 从 80ms 飙到 8s,CPU 却只有 15%——真相是磁盘 I/O 被打满。本文复盘一次 IO 瓶颈雪崩:用 iostat 锁定罪魁、日志风暴止血三板斧、IO 分层根治与 Prometheus 磁盘告警。

suzhe suzhe 2026-09-02
0 0 0
1 2 3 4