LLM可观测性(LLM Observability)指对大模型应用的每次调用进行追踪、记录与分析:输入了什么提示词、检索了哪些资料、调用了哪些工具、模型输出了什么、耗时与成本多少、用户是否满意。非确定性的模型输出让传统日志不够用,需要专门的观测体系。
三大支柱
- 追踪(Tracing):一次请求可能串起 RAG 检索、多轮工具调用、多个模型调用,按链路完整记录每一步的输入输出与耗时
- 评估(Evals):对输出做自动或抽样质量评估,监测质量随版本/模型的漂移
- 成本与延迟监控:按用户/功能维度统计 token 与费用,定位慢在检索还是生成
代表工具
LangSmith、Langfuse(开源自托管常用)、Arize Phoenix、Weights & Biases Weave 等。
为什么重要
AI 应用的 bug 往往不是报错而是“答得变差了”——没有观测体系,你连“哪里变差、何时开始变差、是不是换模型导致的”都无从回答。上线任何正式 AI 功能前,先把观测接上,是比调提示词更优先的工程动作。