一个端点,三个模型家族:Claude、GPT 与 GLM 怎么跑在同一个网关后面
我们刚上线了第三个模型家族。原本路由 Claude 和 GPT 的同一个网关,现在也服务 GLM-5.2 —— 一个 base URL、一个余额、一把 key。这篇讲的是我们怎么做到不打破这个网关赖以成立的两个承诺:不静默降级,和诚实的数据边界。
价值档(value tier)= 挂在同一个网关后面、被清晰单列的低价模型档:适合大批量、成本敏感的任务;与旗舰档共用一把 key 和一个余额,但数据边界按档如实分开声明,绝不混进旗舰档的承诺里。
一个端点,按模型路由
如果你已经在用 OpenAI 兼容或 Anthropic 兼容的 SDK,接入是改两行的事:把 base_url 指向网关、换上 key。路由按请求发生 —— claude-* 走 Anthropic 原生路径(带自动提示缓存注入,下文细说),gpt-* 和 glm-* 走 OpenAI 兼容路径。你的代码不需要知道背后有几个家族。
我们故意不做的事:跨厂 fallback
你点 Claude 而 Claude 不可用,你得到的是一个报错 —— 不是另一个模型悄悄顶上。一个会在高峰期偷偷换供应商的网关,是一个没法用来做评测、跑 agent 管线、做任何在乎模型身份的事的网关。fallback 只发生在同一家族内部,且只朝严格更强的方向。
真正省钱的那部分
对 Claude 模型,网关会自动往你的 system prompt 注入提示缓存标记 —— 客户端零改动。如果你的负载会重复发送稳定上下文(system prompt、工具定义、长文档……也就是几乎每个 agent 和每个编码助手),重复的输入按缓存价计,而不是全价。这不用信我们的话:每个响应的 usage 里都有 cache_read_input_tokens,你自己能验。我们之前写过怎么验证网关的各种声明,一句话版本是:别信承诺,读你自己的 usage 字段。
价值档:GLM-5.2
新加入的是 GLM-5.2:开源权重的 744B MoE 模型,长程编码基准表现很强,上下文窗口很大。它在我们这里是明确单列的价值档 —— 单价见登录后的定价页,数字自己会说话。
它适合的位置:大批量、成本敏感的活 —— 批处理、初稿、分类、代码初筛 —— 用旗舰价的零头先跑一遍,把旗舰模型留给真正需要它的调用。因为一个余额同时覆盖两档,「便宜先跑、旗舰复核」是一个路由决策,不是一次采购立项。
分档的数据边界 —— 白纸黑字
这是大多数网关一笔带过的部分:不是每个模型家族都带着同样的数据保证,装作一样 = 迟早失去信任。
Claude 和 GPT 的请求走官方通道,依这些厂商的商用条款,你的内容不用于训练。GLM 档的供给链路不同,我们能给的保证更窄 —— 所以隐私政策就是这么写的:哪些司法管辖可能适用、哪些事我们无法作出合同性承诺,一条条写明。GLM 只在你显式选择 GLM 模型时才被使用,而且我们把话说白:不想在那些条件下被处理的内容,别发给这一档。
Solunar Gateway
在 console.solunarai.com 注册,改两行,你的一把 key 后面就是 Claude、GPT 和 GLM。文档在 solunarai.com/docs —— 包括数据边界那一节,选档之前值得先读它。
常见问题
选 GLM 会改变我的数据去向吗?
网关会不会悄悄换掉我点的模型?
什么时候用价值档,什么时候用旗舰?
用 GLM 需要单独开户或单独充值吗?
glm-5.2 即可。单价在登录后的定价页,数字自己会说话。继续了解
本文由 AI 辅助起草,事实与观点由创始人审定。