模型与 API 选型雷达
模型目录和免费 API 条款核实于 2026-09-12。正式集成前,务必再次核对官方文档及账号内的实际限额。
通读了七家厂商的资料后,最大的变化不是谁又宣称自己“最强”,而是产品线终于清晰了:旗舰模型攻坚难题,中端模型承担日常流量,小模型低成本处理重复性工作。图像、视频和实时语音也在向专用端点迁移。
所以我不再问“哪家最强”,而是先问三个问题:这个任务值得上旗舰吗?中端模型能搞定吗?为了开放权重的控制权,自己维护推理栈是否划算?
托管 API:先定档位,再选厂商
旧 ID deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 仍被接受,但请求现在转给 V4.1 Flash,并按 Flash 价格计费,不能再选中已退役的原模型。
实操中我会从中端档开始。Terra、Sonnet、Gemini Flash、Grok 和 DeepSeek V4.1 Flash / V4 Pro 都可以进入首轮测试。只有当任务反复失败、值得承担更高成本时,我才会测试 Astra、Sol、Fable 5.1 或 Opus 等更强档位。反之,已经跑顺的提取、分类和格式转换,应继续下放给 Luna、Haiku 或其他更便宜的档位。
这比每个问题都上旗舰更省钱,也比一开始就死磕最低 Token 单价更省心。
免费 API:维护短名单,而非永久榜单
对于个人原型,我现在保留三条主线:Gemini 处理长上下文和多模态,Groq 处理低延迟,OpenRouter 用一个接口试不同免费模型。它们都能零付费起步,但在计量单位、重置周期和数据条款上差异巨大。
最值得记录的不是又多了几家,而是两项退出:Cerebras 当前只有绑定验证支付方式后的 $5、30 天 Free Trial,并没有自动续期的免费层;GitHub Models 已在 2026-07-30 全面退役。 这也暴露了供应商比较文章的保质期:OpenRouter 自己 6 月的免费 API 文章到 8 月已经在这两项上过时。
因此我不会把免费入口接成单点依赖。个人项目可以先用 OpenRouter 统一接口,再把 Gemini 和 Groq 作为有明确任务分工的直连备用;Cloudflare 或 GLM 只在技术栈和语言场景合适时加入。所有免费服务都要处理 429、Retry-After、每日预算和失败切换,也都不该默认接收私有代码或客户数据。
这里讨论的是 API 推理额度,不是终端 Agent 的订阅内含次数。后者单独记录在 AI 编码 CLI 免费额度。
本地推理是另一项决策
当数据必须留在本地,或稳定负载足以支撑服务运行时,请转到本地 AI 技术栈。硬件适配、编码候选、运行时和评测各有独立页面;本页不再复制这些快照。
价格只需扫一眼,别当策略
以下为 2026-09-12 核对的标准文本目录价格,按每百万输入/输出 Token 计价,单位为美元;它们不代表任务总成本或账号使用权益。缓存、批量作业、推理模式、长上下文及合同条款会显著改变实际账单。
我不会看完这张表就换模型。一次调用便宜一半,如果经常重试、修错或卡在工具调用上,最后反而更贵。真正值得记的是一类任务做成一次花多少,不是一个 Token 的挂牌价。
如果今天开新项目
我的顺序是:
- 用最适合现有工作流的中端模型运行五个真实任务;
- 记录失败案例,区分模型问题与工具或提示词问题;
- 仅将顽固难题迁移至旗舰模型;
- 对已变得重复且可预测的工作尝试更便宜的模型;
- 当数据必须留在本地,或负载足以支撑服务运行时,转到本地 AI 技术栈。
这些官网资料足够帮我缩小候选范围,但选不出总冠军。真正有用的下一步,是拿自己的仓库和文档跑同一批任务,保留失败案例,再决定默认用谁。