大语言模型(LLM)应用如何测试?
- 功能测试:提示词效果、工具调用(Function Call)正确性、多轮对话上下文一致性。
- 评测维度:准确性、相关性、鲁棒性、安全性(Prompt 注入/越狱)、幻觉(Hallucination)检测。
- 方法:黄金标准集 + 自动化评估(基于规则/模型评分/人工抽检)、A/B 测试、回归基线(Regression Baseline)对比。
什么是 AI Agent 测试?如何设计用例?
- Agent 测试关注:规划(Plan)合理性、工具选择与参数正确性、执行结果、反思纠错能力、终止条件、超时与失败兜底、安全边界。
- 用例设计:给定任务 → 校验步骤序列、工具调用参数、最终输出、中途异常的恢复行为;配合可观测性(日志、轨迹)与快照对比。
2026/8/21大约 2 分钟