用系统化测试检查 AI 输出是否稳定、可靠、合规。
像奶茶店开门前先试喝十几杯:不是看配方写得多漂亮,是防止忙起来第一单就翻车。
常用于上线验收、版本回归,提前揪出乱答、越权和场景失灵。
LLMOps它通常被纳入模型上线、监控和回归流程。
LLM-as-a-judge它可用模型辅助打分,提升批量测试效率。
Third-party AI evaluation内部自测之外,也常配合外部独立评测。
Hallucination排查幻觉,是它最核心的测试任务之一。