用更快更便宜模型处理简单请求的服务层级。
快速模型层像高速收费站 ETC:小问题抬杆秒过,别堵主路;大货超载再叫强模型。
用于聊天、客服和代理调度,省钱提速,难题转大模型。
Model routing路由决定请求先走快速层,还是直接上强模型。
Small Language Model小模型常承担快速层,处理高频轻量任务。
Fallback model快速层搞不定时,可转给更强的备用模型。
Cost-aware AI快慢分层是控制推理成本的常见办法。