AI 应用可观测:LLM 调用的追踪与评估
LLM 应用是个黑盒:为什么回答变差了?为什么 token 花了这么多?Prompt 追踪、成本审计、质量评估、A/B 实验——AI 应用的可观测体系搭建。
LLM 应用是个黑盒:为什么回答变差了?为什么 token 花了这么多?Prompt 追踪、成本审计、质量评估、A/B 实验——AI 应用的可观测体系搭建。
幻觉是 LLM 的’天性’,治理是系统工程:Prompt 约束、RAG 兜底、引用强制、评测闭环。把 AI 面试的越级率打到 0% 的幻觉治理体系完整复盘。
一个 Agent 搞不定复杂任务怎么办?编排(谁先谁后)、协商(意见冲突)、黑板模式(共享状态)——多智能体协作的三种模式与选型。