Claude / GPT 多模型 API 网关
可靠性策略
围绕超时、重试、模型选择和限流设计生产调用方案。适合高频调用、生产业务、关键流程和需要更明确优先级的项目,包含可执行步骤、配置边界、验证方法和相关排错入口。
超时策略
连接超时、首 token 超时和整体请求超时分开配置。
重试策略
只对可重放请求做指数退避重试,流式中断要记录已返回内容。
观察指标
记录状态码、模型名、耗时、输入输出 token 和上游错误类型。
落地检查
把超时、重试、日志和报警作为上线条件,而不是请求失败后的补丁。 ProTier Models 的公开页面只描述可验证的配置和记录方法,不替代你自己的容量、合规和成本评估。
| 检查项 | 推荐动作 | 记录字段 |
|---|---|---|
| 入口 | 请求 https://protiermodels.top/v1/models | 状态码、模型 ID、时间 |
| 任务 | 按“reliability”页面的场景限制输入和并发 | 任务名、负责人、环境 |
| 成本 | 区分输入、输出、缓存和失败重试 | token、重试率、余额 |