为什么要换模型
成本
日常编码活儿,GLM 和 DeepSeek 每 token 可能便宜一大截。
可用性
一家被限流、封顶或挂了,第二个模型能让你继续往前走。
隐私 / 掌控
本地或自建模型,能把代码留在自己机器或内网里。
模型路由是怎么回事
本质上,编程 agent 就是把 chat-completion 请求发给一个模型接口,再执行它返回的工具调用。如果两家供应商说的是同一套 API 形状——大多数都说 OpenAI 兼容那套——在它们之间切换只是改三样东西:base URL、API key、模型名。agent 的循环不在乎接口后面是哪个模型。
一般要设的东西
| 字段 | 示例 | 说明 |
|---|---|---|
| Base URL | https://…/v1 | 供应商的 OpenAI 兼容接口 |
| API key | 你自己的 key | 按用量计费在你头上 |
| 模型名 | glm-4.7 / deepseek-chat / 你的本地模型 | 那个接口暴露的名字 |
关键是:不是每个客户端都让你换
拦路的通常是客户端,不是模型。绑死一家供应商的 agent 不让你改接口,你就被锁在那家的定价和限额上。想自由路由,你需要一个生来就支持自带模型的客户端——供应商、base URL、key 都是设置项,而不是写死的。
跑本地模型
想完全本地,就用一个暴露 OpenAI 兼容接口的东西把模型服务起来(比如 vLLM),再把 agent 的 base URL 指向你的本地服务。这样代码从不离开你的机器,也完全没有按 token 计费——代价是你得有跑得动模型的硬件。
常见问题
我能用 GLM 或 DeepSeek 代替默认模型吗?
能,只要你的客户端允许设 base URL、key、模型名。GLM 和 DeepSeek 都暴露 OpenAI 兼容接口,支持自定义供应商的客户端可以直接路由过去。
编程 agent 能跑本地模型吗?
能——用一个 OpenAI 兼容的服务(比如 vLLM)把模型起起来,再把 agent 的 base URL 指向本地接口。代码留在你机器上,也没有按 token 的费用。
为什么我现在的 agent 换不了模型?
因为它写死绑了一家供应商。想自由切换,你需要一个把供应商、base URL、key 做成可配置设置项的客户端,而不是固定值。