评估与观测
归纳 Agent 幻觉、任务评估和运行观测的面试要点。
评估与观测
幻觉
幻觉是模型生成了无依据或错误的内容。原因可能来自训练知识不足、输入歧义、检索缺失或模型在不确定时继续补全。
改进时先定位原因,再补充可靠信息、要求来源、校验工具结果,并允许模型说明不知道。提示词或 RAG 都不能单独保证消除幻觉。
Agent 评估
优先检查任务后的实际状态:文件是否正确修改、目标数据是否写入、业务要求是否满足。再看工具选择、参数、失败恢复、步数、成本、延迟和权限边界。
- 有客观标准时,在隔离环境中用断言验证结果。
- 难以直接断言时,用明确量表结合人工抽查和 LLM 评审;模型评分不能自动当作事实。
- WebArena、AgentBench、ToolBench 等基准可作参考,真实业务仍需自己的样本。
监控
把一次请求、模型调用和工具执行串成 trace,记录模型与 Prompt 版本、耗时、token 用量、错误、重试和最终状态。日志按需保留并脱敏,避免完整记录不必要的敏感输入。
OpenTelemetry 可用于链路追踪,Prometheus 与 Grafana 用于指标,ELK 用于日志检索。工具选型之外,要能从失败请求回溯到具体步骤。