本文最后更新于 2026年9月4日。
数据取自官方公共接口 GET https://openrouter.ai/api/v1/models(无需鉴权),核对日期 2026-09-04。全目录 427 个模型,pricing.prompt 与 pricing.completion 同时为 0 的共 21 个,其中 17 个为可用对话模型。文末附自查命令。
一、免费额度
| 历史累计购买额 | RPM | RPD |
|---|---|---|
| < $10 | 20 | 50 |
| ≥ $10 | 20 | 1000 |
以上数字取自官方 limits 文档源码常量 FREE_MODEL_RATE_LIMIT_RPM、FREE_MODEL_NO_CREDITS_RPD、FREE_MODEL_HAS_CREDITS_RPD、FREE_MODEL_CREDITS_THRESHOLD,比渲染后的网页表格可靠。
- 50 RPD 是所有
:free模型共用的日额度,非按模型计数(官方 FAQ 原文 “50 requests per day total”)。 - 充值只提 RPD(50 → 1000),RPM 两档均为 20。分档依据是历史累计购买额,不是当前余额。
- 成功响应不含
X-RateLimit-*,这些响应头只出现在 429 响应中。查询剩余额度调GET /api/v1/key,读limit_remaining、is_free_tier、usage_daily。 - 日额度的重置时区官方未说明,代码里不要写死。
- 账户余额为负时,免费模型同样报错。
二、可用对话模型(17 个)
| 模型 ID | 上下文 | 输入模态 | Tools | 适用 |
|---|---|---|---|---|
minimax/minimax-m3:free |
1.05M | 文本 / 图 / 视频 | 是 | 综合首选;输出上限 94 万 token,长文档与多模态 |
thinkingmachines/inkling:free |
1.05M | 文本 / 图 / 音频 | 是 | 多模态长文推理;支持音频输入 |
thinkingmachines/inkling-small:free |
1.05M | 文本 / 图 / 音频 | 是 | 同上,输出上限 26 万 |
nvidia/nemotron-3-ultra-550b-a55b:free |
1M | 文本 | 是 | 多步规划、编排型 Agent |
nvidia/nemotron-3.5-lightning:free |
1M | 文本 | 是 | 高吞吐批量流水线 |
dots-studio/dots-3-note-preview:free |
512K | 文本 / 图 | 是 | 长文档笔记与抽取;官方标注到期日 2026-09-30,勿作长期依赖 |
google/gemma-4-31b-it:free |
262K | 文本 / 图 / 视频 | 是 | Google 原厂托管,稳定性优先场景 |
google/gemma-4-26b-a4b-it:free |
262K | 文本 / 图 / 视频 | 是 | MoE,激活参数更小,延迟更低 |
nvidia/nemotron-3-super-120b-a12b:free |
262K | 文本 | 是 | 输出上限 23 万 token,长输出任务 |
z-ai/glm-5.2:free |
256K | 文本 | 是 | 中文场景;输出上限 23 万 |
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free |
256K | 文本 / 音频 / 图 / 视频 | 是 | 模态最全,多模态感知子 Agent |
cohere/north-mini-code:free |
256K | 文本 | 是 | 小体量编码模型,Apache-2.0 |
poolside/laguna-s-2.1:free |
262K | 文本 | 是 | Agentic 编码 |
poolside/laguna-xs-2.1:free |
262K | 文本 | 是 | laguna 轻量版 |
minimax/minimax-m2.7:free |
197K | 文本 | 是 | 日常生产力、多 Agent |
inclusionai/ling-3.0-flash-fin:free |
262K | 文本 | 是 | 金融投研类多步任务 |
liquid/lfm-2.5-2.6b:free |
65K | 文本 | 是 | 端侧抽取、RAG 后处理;官方不建议用于 Agentic 编码 |
17 个模型的 supported_parameters 均含 tools 与 reasoning。这是模型级声明,不代表每个上游 provider 都实现,需配合 require_parameters 使用(见第五节)。
三、排除项(价格 0 但非对话模型)
google/lyria-3-pro-preview、google/lyria-3-clip-preview:音乐生成,输出为音频。token 单价 0,按条计费(整首约 $0.08,30 秒片段约 $0.04)。nvidia/nemotron-3.5-content-safety:free:内容安全审核,输出为审核判定。openrouter/free:非实体模型,是官方的免费模型随机路由器,按本次请求所需能力过滤后随机挑选。仅适合末级兜底,输出风格与上下文连续性无法保证。
四、实际提供推理的 provider
| 模型 ID | provider |
|---|---|
google/gemma-4-31b-it:free |
Google AI Studio(原厂) |
nvidia/nemotron-3-super-120b-a12b:free |
Nvidia(原厂) |
nvidia/nemotron-3-ultra-550b-a55b:free |
Nvidia(原厂) |
poolside/laguna-s-2.1:free |
Poolside(原厂) |
thinkingmachines/inkling:free |
Thinking Machines(原厂) |
minimax/minimax-m3:free |
GMICloud(第三方) |
z-ai/glm-5.2:free |
Decart(第三方,非 Z.ai 自营) |
默认路由为按价格加权的负载均衡,仅排除最近 30 秒内有故障的节点,属事后感知。需固定或排序时用 provider.only、provider.order、provider.allow_fallbacks、provider.ignore。可用 GET /api/v1/models/{id}/endpoints 自查当前 provider。
五、调用
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-H "HTTP-Referer: https://your-site.com" \
-H "X-OpenRouter-Title: your-app-name" \
-d '{
"models": [
"minimax/minimax-m3:free",
"z-ai/glm-5.2:free",
"openrouter/free"
],
"messages": [
{"role": "user", "content": "用 Go 写一个带指数退避的 HTTP 重试"}
],
"provider": {
"require_parameters": true,
"allow_fallbacks": true
}
}'
models数组是降级链,按顺序尝试,按实际命中的模型计费,响应体model字段给出最终使用的模型。provider.require_parameters: true:默认路由下tools与response_format只是软偏好,若所有 provider 均不支持会被静默忽略。加上该参数后只路由到确实支持这些参数的 provider。HTTP-Referer与X-OpenRouter-Title用于应用归因与榜单展示,可选(X-Title为旧写法)。
流式请求被限流时,HTTP 状态码仍为 200
错误以 SSE 事件下发:data: {"choices":[{"finish_reason":"error", ...}]}。只判断状态码的客户端会误判为”正常结束但无内容”,需在 SSE 解析中显式处理 finish_reason == "error"。
查询剩余额度
import os
import requests
r = requests.get(
"https://openrouter.ai/api/v1/key",
headers={"Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}"},
timeout=10,
)
data = r.json()["data"]
print("免费档:", data["is_free_tier"])
print("剩余额度:", data.get("limit_remaining"))
print("今日用量:", data["usage_daily"])
错误码
- 402 余额不足(负余额也会影响免费模型)。
- 404 模型不存在,或被隐私设置拦截。
- 429 限流。平台级限流带
X-RateLimit-Limit/-Remaining/-Reset;上游 provider 限流时错误体metadata.provider_code含原始错误码,此类 OpenRouter 已自动换 provider 重试过一轮。429 与 503 可能带Retry-After,优先采用,无则指数退避。 - 502
provider_unavailable,503provider_overloaded或无满足条件的 provider,重试通常有效。
六、与其他免费端点配合
50 RPD 只适合兜底与容灾,主力建议走大额免费端点或低价付费。
| 端点 | Base URL | 免费额度 | 绑卡 / 实名 |
|---|---|---|---|
| OpenRouter | https://openrouter.ai/api/v1 |
20 RPM / 50 RPD,累计充值 $10 后 1000 RPD | 否,邮箱注册 |
| ModelScope API-Inference | https://api-inference.modelscope.cn/v1 |
2000 次/日,单模型上限 500 次/日 | 需阿里云账号并实名 |
| Cloudflare Workers AI | https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/run |
10,000 Neurons/日,00:00 UTC 重置 | 否 |
| Groq | https://api.groq.com/openai/v1 |
约 30 RPM / 1000 RPD(待复核,官方 console 返回 403) | 否 |
| Google AI Studio | https://generativelanguage.googleapis.com/v1beta/openai/ |
Gemini 免费层,按机型分档 | 否 |
| OVHcloud | https://oai.endpoints.kepler.ai.cloud.ovh.net/v1 |
匿名 2 RPM,无需 key | 否,免注册 |
GitHub Models 已于 2026-07-30 退役,Cerebras 已取消永久免费层(仅剩需绑卡的试用金),两者不应再进入新代码。上表除 OpenRouter 与 Cloudflare 外,额度未取得官方一手确认,标待复核者请以 x-ratelimit-* 实测。
现成网关(均支持 OpenRouter):LiteLLM(约 5.8 万 star,OpenAI 格式统一 100+ 模型,内置 fallback、负载均衡、成本统计);FreeLLMAPI(约 2.4 万 star,聚合 30+ 免费 provider 的数千端点,内置 429 failover、冷却与 key 轮换)。
七、自查
PowerShell:
(irm https://openrouter.ai/api/v1/models).data |
? { $_.pricing.prompt -eq 0 -and $_.pricing.completion -eq 0 } |
select id, context_length
Linux / macOS:
curl -s https://openrouter.ai/api/v1/models \
| jq -r '.data[] | select(.pricing.prompt=="0" and .pricing.completion=="0") |
"\(.id)\t\(.context_length)"'
免费模型 ID 变更频繁,请勿在代码中硬编码单个 ID,改用 models 降级链并在启动时校验 ID 是否存在。