按任务把请求分配给不同模型的策略。
它像医院分诊:小感冒别挂院士号,疑难杂症再请专家上场。
它常用于多模型服务,按成本、速度和难度分配请求。
LLMModel routing 会把请求分配给更合适的 LLM。
Inference它决定一次请求该进入哪条推理路径。
AgentAgent 执行不同环节时,常会切换不同模型。
LlmopsModel routing 是多模型部署与成本优化的一部分。