跳到主要内容

模型与 API 选型雷达

模型目录和免费 API 条款核实于 2026-09-12。正式集成前,务必再次核对官方文档及账号内的实际限额。

通读了七家厂商的资料后,最大的变化不是谁又宣称自己“最强”,而是产品线终于清晰了:旗舰模型攻坚难题,中端模型承担日常流量,小模型低成本处理重复性工作。图像、视频和实时语音也在向专用端点迁移。

所以我不再问“哪家最强”,而是先问三个问题:这个任务值得上旗舰吗?中端模型能搞定吗?为了开放权重的控制权,自己维护推理栈是否划算?

托管 API:先定档位,再选厂商

厂商当前产品线我的解读
OpenAIGPT-6 Astra;GPT-5.6 Sol / Terra / LunaOpenAI 将 Astra 定位为处理最难端到端任务的旗舰。Sol 仍可用,Terra 和 Luna 承担成本更低的工作。四者均标称 1.05M 上下文,但长文档的可靠性不能只看容量参数。
AnthropicClaude Fable 5.1 / Opus 5 / Sonnet 5 / Haiku 4.5Anthropic 将 Fable 5.1 定位于高难推理和长程 Agent 任务,Opus 5 面向复杂 Agent 编码,Sonnet 5 平衡速度与智能,Haiku 4.5 侧重低延迟。
GoogleGemini 3.8 Flash(稳定版)/ Gemini 3.1 Pro(预览版),以及 Live、图像和视频模型模态划分非常清晰。实时语音或原生媒体处理,应测试专用端点,而不是让文本旗舰模型包揽一切。
xAIGrok 4.6,以及 Imagine 和 Voice APIGrok 4.6 侧重代码与对话。时事信息依赖搜索工具,并非模型内置能力。
DeepSeekV4.1 Flash / V4 Pro(0813)deepseek-flash 对应 V4.1 Flash,支持视觉;deepseek-v4-pro 对应 V4 Pro-0813,不支持视觉。两者均支持思考/非思考模式、Responses API,以及 OpenAI/Anthropic 格式访问。

旧 ID deepseek-v4-flashdeepseek-v4-flash-vision-exp 仍被接受,但请求现在转给 V4.1 Flash,并按 Flash 价格计费,不能再选中已退役的原模型。

实操中我会从中端档开始。Terra、Sonnet、Gemini Flash、Grok 和 DeepSeek V4.1 Flash / V4 Pro 都可以进入首轮测试。只有当任务反复失败、值得承担更高成本时,我才会测试 Astra、Sol、Fable 5.1 或 Opus 等更强档位。反之,已经跑顺的提取、分类和格式转换,应继续下放给 Luna、Haiku 或其他更便宜的档位。

这比每个问题都上旗舰更省钱,也比一开始就死磕最低 Token 单价更省心。

免费 API:维护短名单,而非永久榜单

对于个人原型,我现在保留三条主线:Gemini 处理长上下文和多模态,Groq 处理低延迟,OpenRouter 用一个接口试不同免费模型。它们都能零付费起步,但在计量单位、重置周期和数据条款上差异巨大。

服务当前零付费入口我会怎么用先看清的限制
Gemini Developer API当前有 Free tier,AI Studio 在支持地区免费长文档、多模态和研究原型配额按模型变化;免费层内容可能用于改进 Google 产品,敏感资料不放进去
GroqFree Plan,按组织和模型限制 RPM、RPD、TPM、TPD低延迟聊天、语音和工具 Worker官网只给高层摘要,账号内 Limits 页面才是当前精确值
OpenRouter :free多供应商免费模型,共用一套兼容接口快速试模型和做简单 Fallback免费变体有平台级分钟/每日上限;信用余额与上游拥堵也会影响调用
MistralFree mode 默认开放 API,无需信用卡Mistral 模型原型官方只承诺有限用量和限流,没有稳定的公开数字
Cloudflare Workers AI每天 10,000 Neurons 免费,00:00 UTC 重置已在 Cloudflare 上的边缘任务Neuron 不是 Token;部分前沿模型要求付费方案或预付 Credits
智谱 GLM-4.7-Flash位于官方免费模型目录,提供 OpenAI 风格 Chat Completions中文和 Agentic Coding 备选文档页给出 200K 上下文和 128K 最大输出,但未写清可依赖的每日/月度额度
Hugging Face Inference ProvidersFree 用户每月 $0.10 Credits,金额可能调整,仅适用于经 Hugging Face 路由的请求验证客户端或跑极小测试自定义供应商 key 不使用这笔额度;它更像持续的小额试用,不适合作为主力服务

最值得记录的不是又多了几家,而是两项退出:Cerebras 当前只有绑定验证支付方式后的 $5、30 天 Free Trial,并没有自动续期的免费层;GitHub Models 已在 2026-07-30 全面退役。 这也暴露了供应商比较文章的保质期:OpenRouter 自己 6 月的免费 API 文章到 8 月已经在这两项上过时。

因此我不会把免费入口接成单点依赖。个人项目可以先用 OpenRouter 统一接口,再把 Gemini 和 Groq 作为有明确任务分工的直连备用;Cloudflare 或 GLM 只在技术栈和语言场景合适时加入。所有免费服务都要处理 429、Retry-After、每日预算和失败切换,也都不该默认接收私有代码或客户数据。

这里讨论的是 API 推理额度,不是终端 Agent 的订阅内含次数。后者单独记录在 AI 编码 CLI 免费额度

本地推理是另一项决策

当数据必须留在本地,或稳定负载足以支撑服务运行时,请转到本地 AI 技术栈。硬件适配、编码候选、运行时和评测各有独立页面;本页不再复制这些快照。

价格只需扫一眼,别当策略

以下为 2026-09-12 核对的标准文本目录价格,按每百万输入/输出 Token 计价,单位为美元;它们不代表任务总成本或账号使用权益。缓存、批量作业、推理模式、长上下文及合同条款会显著改变实际账单。

厂商当前层级(输入 / 输出)
OpenAIAstra 10 / 50; Sol 4 / 20; Terra 2 / 12; Luna 0.20 / 1.20
AnthropicFable 5.1: 10 / 50; Opus 5: 5 / 25; Sonnet 5: 2 / 10; Haiku 4.5: 1 / 5
xAIGrok 4.6: 2 / 6
DeepSeek按高峰/低谷及缓存命中/未命中分层,单一标价具有误导性

我不会看完这张表就换模型。一次调用便宜一半,如果经常重试、修错或卡在工具调用上,最后反而更贵。真正值得记的是一类任务做成一次花多少,不是一个 Token 的挂牌价。

如果今天开新项目

我的顺序是:

  1. 用最适合现有工作流的中端模型运行五个真实任务;
  2. 记录失败案例,区分模型问题与工具或提示词问题;
  3. 仅将顽固难题迁移至旗舰模型;
  4. 对已变得重复且可预测的工作尝试更便宜的模型;
  5. 当数据必须留在本地,或负载足以支撑服务运行时,转到本地 AI 技术栈

这些官网资料足够帮我缩小候选范围,但选不出总冠军。真正有用的下一步,是拿自己的仓库和文档跑同一批任务,保留失败案例,再决定默认用谁。

探索关联打开关联网络