2026 年我的全栈与 AI 技术栈演进:从工程底座到 Agent 与 RAG 生态
深入分享我在 2026 年的全栈与 AI 混合技术栈架构:以 Claude Code 和 Pi Agent 为主力编程助手,以 GLM 为核心基座大模型,以 Python + FastAPI + LangGraph + RAG 为 AI 引擎,并探索 FastMCP、FastGPT 与 RAGFlow 的企业级落地。
深入分享我在 2026 年的全栈与 AI 混合技术栈架构:以 Claude Code 和 Pi Agent 为主力编程助手,以 GLM 为核心基座大模型,以 Python + FastAPI + LangGraph + RAG 为 AI 引擎,并探索 FastMCP、FastGPT 与 RAGFlow 的企业级落地。
当多轮对话聊到 30 甚至 50 轮,滑动窗口滑走了开头的关键约束、全量保留又会挤爆 Token 上下文,RAG 系统该如何破局?深入剖析 Ragent 记忆系统中的增量摘要压缩算法、lastMessageId 水位线推进机制、攒批压缩优化(summaryBatchSize)、Prompt 绝对禁止记录答案的设计哲学以及 Redisson 分布式锁防重实践。
大语言模型 API 天然是无状态的,如何让每次独立的请求表现为连贯自然的连续对话?深入剖析 Ragent 问答流水线阶段一(loadMemory)背后的三层记忆架构、异步并发拉取与容错降级、滑动窗口规整(normalizeHistory)、loadAndAppend 时序避坑以及结构化 Prompt 上下文注入顺序。
深入剖析阿里巴巴开源 TransmittableThreadLocal (TTL) 的底层机制(Capture、Replay、Restore 与 Holder 弱引用字典),彻底破解线程池复用下的上下文丢失与污染困境。结合生产级 RAG 架构,实战解析如何利用全局 traceId 实现多路并发检索归因、分阶段耗时(TTFT/TBT)拆解与单次请求 Token 级成本精细化核算。
从用户在前端输入一句话到打字机式流式响应返回,生产级 RAG & Agent 问答系统后端究竟经历了什么?深度解构 Ragent 项目中 StreamChatPipeline 的八阶段线性编排、三大短路分支、数据总线设计以及前置幂等/限流/Trace 工程防线。
搜广推系统中的双塔模型和 RAG 中的向量检索,一个诞生于推荐系统,一个兴起于大模型时代。当我把两者的架构图放在一起时,突然发现它们竟如此相似——本质上都是在向量空间中寻找最近的"灵魂伴侣"。