所有模型,一个地址
你的代码只管调用网关。由哪个供应商来接这次请求,网关来定,并把经过记下来。
网关替你扛下的活
第二个模型、第二个供应商、第二个团队一进来,这些活立刻就冒出来了。
切换不该是你的事
某个供应商变慢或报错时,策略里的下一个直接接手,不需要发一次版。
真会咬人的支出上限
按团队、按密钥的上限在网关处强制执行,而不是在账单上才发现。
供应商密钥只放一处
应用手里拿的是网关密钥。供应商的凭据从不离开网关。
重复的活不再花钱
完全相同的请求走缓存,命中率就摆在支出旁边。
网关支持什么
- 供应商
- Anthropic、OpenAI、Google、Mistral,以及你自建的任何 OpenAI 兼容端点。
- 路由
- 加权、看成本、看延迟、锁区域的多种策略,配有序的故障转移。
- 上限
- 按密钥、按团队、按模型的速率与支出上限。
- 缓存
- 完全匹配与提示前缀匹配,可按路由分别配置。
- 记录
- 每次请求都留存模型、令牌、成本、延迟与调用方。
把生产流量接进来之前
当一个组件横在所有模型调用前面时,平台团队会问的问题。