openrouter免费模型汇总(2026-09)

2555 次阅读

本文最后更新于 2026年9月4日。

数据取自官方公共接口 GET https://openrouter.ai/api/v1/models(无需鉴权),核对日期 2026-09-04。全目录 427 个模型,pricing.prompt 与 pricing.completion 同时为 0 的共 21 个,其中 17 个为可用对话模型。文末附自查命令。

一、免费额度

历史累计购买额 RPM RPD
< $10 20 50
≥ $10 20 1000

以上数字取自官方 limits 文档源码常量 FREE_MODEL_RATE_LIMIT_RPM、FREE_MODEL_NO_CREDITS_RPD、FREE_MODEL_HAS_CREDITS_RPD、FREE_MODEL_CREDITS_THRESHOLD,比渲染后的网页表格可靠。

  • 50 RPD 是所有 :free 模型共用的日额度,非按模型计数(官方 FAQ 原文 “50 requests per day total”)。
  • 充值只提 RPD(50 → 1000),RPM 两档均为 20。分档依据是历史累计购买额,不是当前余额。
  • 成功响应不含 X-RateLimit-*,这些响应头只出现在 429 响应中。查询剩余额度调 GET /api/v1/key,读 limit_remaining、is_free_tier、usage_daily。
  • 日额度的重置时区官方未说明,代码里不要写死。
  • 账户余额为负时,免费模型同样报错。

二、可用对话模型(17 个)

模型 ID 上下文 输入模态 Tools 适用
minimax/minimax-m3:free 1.05M 文本 / 图 / 视频 是 综合首选;输出上限 94 万 token,长文档与多模态
thinkingmachines/inkling:free 1.05M 文本 / 图 / 音频 是 多模态长文推理;支持音频输入
thinkingmachines/inkling-small:free 1.05M 文本 / 图 / 音频 是 同上,输出上限 26 万
nvidia/nemotron-3-ultra-550b-a55b:free 1M 文本 是 多步规划、编排型 Agent
nvidia/nemotron-3.5-lightning:free 1M 文本 是 高吞吐批量流水线
dots-studio/dots-3-note-preview:free 512K 文本 / 图 是 长文档笔记与抽取;官方标注到期日 2026-09-30,勿作长期依赖
google/gemma-4-31b-it:free 262K 文本 / 图 / 视频 是 Google 原厂托管,稳定性优先场景
google/gemma-4-26b-a4b-it:free 262K 文本 / 图 / 视频 是 MoE,激活参数更小,延迟更低
nvidia/nemotron-3-super-120b-a12b:free 262K 文本 是 输出上限 23 万 token,长输出任务
z-ai/glm-5.2:free 256K 文本 是 中文场景;输出上限 23 万
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free 256K 文本 / 音频 / 图 / 视频 是 模态最全,多模态感知子 Agent
cohere/north-mini-code:free 256K 文本 是 小体量编码模型,Apache-2.0
poolside/laguna-s-2.1:free 262K 文本 是 Agentic 编码
poolside/laguna-xs-2.1:free 262K 文本 是 laguna 轻量版
minimax/minimax-m2.7:free 197K 文本 是 日常生产力、多 Agent
inclusionai/ling-3.0-flash-fin:free 262K 文本 是 金融投研类多步任务
liquid/lfm-2.5-2.6b:free 65K 文本 是 端侧抽取、RAG 后处理;官方不建议用于 Agentic 编码

17 个模型的 supported_parameters 均含 tools 与 reasoning。这是模型级声明,不代表每个上游 provider 都实现,需配合 require_parameters 使用(见第五节)。

三、排除项(价格 0 但非对话模型)

  • google/lyria-3-pro-preview、google/lyria-3-clip-preview:音乐生成,输出为音频。token 单价 0,按条计费(整首约 $0.08,30 秒片段约 $0.04)。
  • nvidia/nemotron-3.5-content-safety:free:内容安全审核,输出为审核判定。
  • openrouter/free:非实体模型,是官方的免费模型随机路由器,按本次请求所需能力过滤后随机挑选。仅适合末级兜底,输出风格与上下文连续性无法保证。

四、实际提供推理的 provider

模型 ID provider
google/gemma-4-31b-it:free Google AI Studio(原厂)
nvidia/nemotron-3-super-120b-a12b:free Nvidia(原厂)
nvidia/nemotron-3-ultra-550b-a55b:free Nvidia(原厂)
poolside/laguna-s-2.1:free Poolside(原厂)
thinkingmachines/inkling:free Thinking Machines(原厂)
minimax/minimax-m3:free GMICloud(第三方)
z-ai/glm-5.2:free Decart(第三方,非 Z.ai 自营)

默认路由为按价格加权的负载均衡,仅排除最近 30 秒内有故障的节点,属事后感知。需固定或排序时用 provider.only、provider.order、provider.allow_fallbacks、provider.ignore。可用 GET /api/v1/models/{id}/endpoints 自查当前 provider。

五、调用

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -H "HTTP-Referer: https://your-site.com" \
  -H "X-OpenRouter-Title: your-app-name" \
  -d '{
    "models": [
      "minimax/minimax-m3:free",
      "z-ai/glm-5.2:free",
      "openrouter/free"
    ],
    "messages": [
      {"role": "user", "content": "用 Go 写一个带指数退避的 HTTP 重试"}
    ],
    "provider": {
      "require_parameters": true,
      "allow_fallbacks": true
    }
  }'
  • models 数组是降级链,按顺序尝试,按实际命中的模型计费,响应体 model 字段给出最终使用的模型。
  • provider.require_parameters: true:默认路由下 tools 与 response_format 只是软偏好,若所有 provider 均不支持会被静默忽略。加上该参数后只路由到确实支持这些参数的 provider。
  • HTTP-Referer 与 X-OpenRouter-Title 用于应用归因与榜单展示,可选(X-Title 为旧写法)。

流式请求被限流时,HTTP 状态码仍为 200

错误以 SSE 事件下发:data: {"choices":[{"finish_reason":"error", ...}]}。只判断状态码的客户端会误判为”正常结束但无内容”,需在 SSE 解析中显式处理 finish_reason == "error"。

查询剩余额度

import os
import requests

r = requests.get(
    "https://openrouter.ai/api/v1/key",
    headers={"Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}"},
    timeout=10,
)
data = r.json()["data"]
print("免费档:", data["is_free_tier"])
print("剩余额度:", data.get("limit_remaining"))
print("今日用量:", data["usage_daily"])

错误码

  • 402 余额不足(负余额也会影响免费模型)。
  • 404 模型不存在,或被隐私设置拦截。
  • 429 限流。平台级限流带 X-RateLimit-Limit/-Remaining/-Reset;上游 provider 限流时错误体 metadata.provider_code 含原始错误码,此类 OpenRouter 已自动换 provider 重试过一轮。429 与 503 可能带 Retry-After,优先采用,无则指数退避。
  • 502 provider_unavailable,503 provider_overloaded 或无满足条件的 provider,重试通常有效。

六、与其他免费端点配合

50 RPD 只适合兜底与容灾,主力建议走大额免费端点或低价付费。

端点 Base URL 免费额度 绑卡 / 实名
OpenRouter https://openrouter.ai/api/v1 20 RPM / 50 RPD,累计充值 $10 后 1000 RPD 否,邮箱注册
ModelScope API-Inference https://api-inference.modelscope.cn/v1 2000 次/日,单模型上限 500 次/日 需阿里云账号并实名
Cloudflare Workers AI https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/run 10,000 Neurons/日,00:00 UTC 重置 否
Groq https://api.groq.com/openai/v1 约 30 RPM / 1000 RPD(待复核,官方 console 返回 403) 否
Google AI Studio https://generativelanguage.googleapis.com/v1beta/openai/ Gemini 免费层,按机型分档 否
OVHcloud https://oai.endpoints.kepler.ai.cloud.ovh.net/v1 匿名 2 RPM,无需 key 否,免注册

GitHub Models 已于 2026-07-30 退役,Cerebras 已取消永久免费层(仅剩需绑卡的试用金),两者不应再进入新代码。上表除 OpenRouter 与 Cloudflare 外,额度未取得官方一手确认,标待复核者请以 x-ratelimit-* 实测。

现成网关(均支持 OpenRouter):LiteLLM(约 5.8 万 star,OpenAI 格式统一 100+ 模型,内置 fallback、负载均衡、成本统计);FreeLLMAPI(约 2.4 万 star,聚合 30+ 免费 provider 的数千端点,内置 429 failover、冷却与 key 轮换)。

七、自查

PowerShell:

(irm https://openrouter.ai/api/v1/models).data |
  ? { $_.pricing.prompt -eq 0 -and $_.pricing.completion -eq 0 } |
  select id, context_length

Linux / macOS:

curl -s https://openrouter.ai/api/v1/models \
  | jq -r '.data[] | select(.pricing.prompt=="0" and .pricing.completion=="0") |
    "\(.id)\t\(.context_length)"'

免费模型 ID 变更频繁,请勿在代码中硬编码单个 ID,改用 models 降级链并在启动时校验 ID 是否存在。

相关阅读