模型与 API 雷达
快照
核验于 2026-08-04。除特别说明外,价格为每百万标准文本 token 的美元价格。缓存、batch、工具调用、订阅、预览和地区渠道都会改变实际成本;投入生产或花费大额资金前必须重查官方来源。
个人默认选择
对于出错代价较高的交互式编码,当前默认是 GPT-5.6 Sol + high reasoning。这是一条有效的个人工作偏好,不是假装普适的排行榜冠军。不能仅因为 token 表更便宜,就降低高后果任务的模型质量。
- 质量优先的编码和审查: GPT-5.6 Sol / high。
- 检查机制可靠的常规实现: 用相同任务试跑 GPT-5.6 Terra。
- 批量分类、翻译和提取: 在确定性校验下试用 Luna 或低价 Flash。
- 重要分歧或提供商专属任务: 用强 Claude 或 Gemini 交叉检查。
代表性 API 快照
| 提供商 | 模型 | 输入 | 输出 | 定位 |
|---|---|---|---|---|
| OpenAI | gpt-5.6-sol | $5.00 | $30.00 | 复杂推理与编码旗舰 |
| OpenAI | gpt-5.6-terra | $2.00 | $12.00 | 智力与成本平衡 |
| OpenAI | gpt-5.6-luna | $0.20 | $1.20 | 成本敏感的大批量任务 |
| Anthropic | claude-fable-5 | $10.00 | $50.00 | 最强能力、长时间智能体 |
| Anthropic | claude-opus-5 | $5.00 | $25.00 | 复杂 agentic coding |
| Anthropic | claude-sonnet-5 | $3.00 | $15.00 | 速度与智能平衡 |
gemini-3.6-flash | $1.50 | $7.50 | 带 grounding 的快速前沿模型 | |
gemini-3.5-flash-lite | $0.30 | $2.50 | 高吞吐 agentic 与简单处理 |
Anthropic 标注 Sonnet 5 在 2026-08-31 前有 10 的首发价;这里不用临时价格作为长期比较基线。
如何比较性价比
不要只看价格和公开 benchmark。重放一小套个人评估任务并记录:任务成功率和错误严重度、人工修正量、耗时、各种 token、工具调用与重试,以及每个被接受结果的总成本。
最便宜的成功运行有意义,最便宜的尝试没有意义。
复查时直接替换表格和路由决策。只有当变化影响个人默认、主要工作流或预期成本时,才值得留下变更记录。