List of Permanent Free LLM API (API Keys)
| Files | Last commit | Last update |
|---|---|---|
| 4 months ago | ||
| 1 month ago | ||
| 5 months ago | ||
| 1 month ago | ||
| 1 month ago | ||
| 4 months ago | ||
| 1 month ago | ||
| 5 months ago | ||
| 1 month ago | ||
| 5 months ago |
提供永久免费额度的LLM API,用于文本推理。
除非另有说明,所有接口均兼容OpenAI SDK。每个链接均指向提供商的API密钥页面。
所有这些免费LLM API均可在 manifest.build 获取 - 构建可靠的智能体。
目录
提供商API
由训练或微调模型的公司直接运营的API。
Aion Labs 🇮🇱
永久免费额度,无需信用卡。15次/分钟(RPM),20,000 tokens/天(TPD)。专为角色扮演和故事讲述优化。
基础URL:https://api.aionlabs.ai/v1
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| Aion 2.5 | 128K | 32K | 文本(角色扮演) | 15 RPM,20K TPD |
| Aion 2.0 | 128K | 32K | 文本(角色扮演) | 15 RPM,20K TPD |
| Aion-RP 1.0 (8B) | 32K | ~8K | 文本(角色扮演) | 15 RPM,20K TPD |
Cohere 🇨🇦
免费"试用"API密钥,无需信用卡。每月1,000次API调用。仅限非商业用途。
基础URL:https://api.cohere.com/v2
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| Command A+ (218B) | 128K | 4K | 文本 | 20 RPM |
| Command A (111B) | 256K | 4K | 文本 | 20 RPM |
| Command R+ | 128K | 4K | 文本 | 20 RPM |
| Command R | 128K | 4K | 文本 | 20 RPM |
| Command R7B | 128K | 4K | 文本 | 20 RPM |
Google Gemini 🇺🇸
欧盟/英国/瑞士地区无法使用免费套餐。免费套餐的提示词可能会被 Google 用于产品改进。[1]
基础 URL:https://generativelanguage.googleapis.com/v1beta
| 模型名称 | 上下文 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| Gemini 3.5 Flash | 100万 | 64K | 文本 + 图像 + 音频 + 视频 | 15 次/分钟,1500 次/天 |
| Gemini 3.1 Flash-Lite | 100万 | 65K | 文本 + 图像 + 音频 + 视频 | 30 次/分钟,1500 次/天 |
| Gemini 2.5 Flash | 100万 | 65K | 文本 + 图像 + 音频 + 视频 | 15 次/分钟,1500 次/天 |
| Gemini 2.5 Pro | 200万 | 65K | 文本 + 图像 + 音频 + 视频 | 5 次/分钟,50 次/天 |
Mistral AI 🇫🇷
免费的“实验”计划,无需信用卡。约10亿 tokens/月。提示词可能会被用于模型改进。
基础 URL:https://api.mistral.ai/v1
| 模型名称 | 上下文 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| Mistral Medium 3.5 (128B) | 256K | 256K | 文本 + 图像 + 代码 | 约1次/秒,50万 tokens/分钟 |
| Mistral Small 4 | 256K | 256K | 文本 + 图像 + 代码 | 约1次/秒,50万 tokens/分钟 |
| Mistral Large 3 | 256K | 256K | 文本 | 约1次/秒,50万 tokens/分钟 |
| Mistral Nemo (12B) | 128K | 128K | 文本 | 约1次/秒,50万 tokens/分钟 |
| Codestral | 256K | 256K | 代码 | 约1次/秒,50万 tokens/分钟 |
| Pixtral Large | 128K | 128K | 文本 + 图像 | 约1次/秒,50万 tokens/分钟 |
Z AI (Zhipu AI) 🇨🇳
永久免费模型,无需信用卡。
基础 URL:https://open.bigmodel.cn/api/paas/v4
| 模型名称 | 上下文 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| GLM-4.7-Flash | 200K | 128K | 文本 | 1个并发请求 |
| GLM-4.6V-Flash | 128K | 约4K | 文本 + 图像 | 1个并发请求 |
推理服务提供商
第三方平台,托管来自不同来源的开源权重模型。
Cerebras 🇺🇸
提供免费套餐,无需信用卡。推理速度极快(约 2,600 令牌/秒)。每日限额 100 万令牌。免费套餐的上下文长度上限为 8K。
基础 URL:https://api.cerebras.ai/v1
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| gpt-oss-120b | 128K(免费版为 8K) | 8K | 文本 | 30 次/分钟,14,400 次/天,100 万令牌/天 |
| zai-glm-4.7 | 128K(免费版为 8K) | 8K | 文本 | 10 次/分钟,100 次/天,100 万令牌/天 |
Cloudflare Workers AI 🇺🇸
每日免费提供 10,000 神经元额度。免费套餐包含 50 多种模型。
基础 URL:https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/run
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
@cf/meta/llama-3.3-70b-instruct-fp8-fast |
131K | 与上下文共享 | 文本 | 10,000 神经元/天(共享) |
@cf/meta/llama-4-scout-17b-16e-instruct |
最高 10M | 与上下文共享 | 多模态 | 10,000 神经元/天(共享) |
@cf/openai/gpt-oss-120b |
128K | 与上下文共享 | 文本 | 10,000 神经元/天(共享) |
@cf/moonshotai/kimi-k2.7-code |
262K | 与上下文共享 | 文本(代码) | 10,000 神经元/天(共享) |
@cf/google/gemma-4-26b-a4b-it |
256K | 与上下文共享 | 文本 | 10,000 神经元/天(共享) |
@cf/zhipuai/glm-4.7-flash |
131K | 与上下文共享 | 文本 | 10,000 神经元/天(共享) |
@cf/mistralai/mistral-small-3.1-24b-instruct |
128K | 与上下文共享 | 文本 | 10,000 神经元/天(共享) |
@cf/deepseek-ai/deepseek-r1-distill-qwen-32b |
32K | 与上下文共享 | 文本(推理) | 10,000 神经元/天(共享) |
| + 42 个更多模型 | 各不相同 | 各不相同 | 文本、图像、音频、嵌入 | 10,000 神经元/天(共享) |
GitHub Models 🇺🇸
所有 GitHub 用户均可免费进行原型开发。提供 45 余款模型。设有单请求限制(输入 8K / 输出 4K)。
基础 URL:https://models.github.ai/inference
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| gpt-5 | 200K | 32K | 文本 | 10 次/分钟,50 次/天 |
| gpt-4.1 | 1M | 32K | 文本 | 10 次/分钟,50 次/天 |
| gpt-4.1-mini | 1M | 32K | 文本 | 15 次/分钟,150 次/天 |
| gpt-4o | 128K | 16K | 文本 + 视觉 | 10 次/分钟,50 次/天 |
| o4-mini | 200K | 100K | 文本(推理) | 10 次/分钟,50 次/天 |
| Llama-4-Scout-17B-16E-Instruct | 512K | ~4K | 文本 + 视觉 | 15 次/分钟,150 次/天 |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 256K | ~4K | 文本 + 视觉 | 10 次/分钟,50 次/天 |
| Llama-3.3-70B-Instruct | 131K | ~4K | 文本 | 15 次/分钟,150 次/天 |
| DeepSeek-R1 | 64K | 8K | 文本(推理) | 15 次/分钟,150 次/天 |
| Mistral-Small-3.1 | 128K | ~4K | 文本 + 视觉 | 15 次/分钟,150 次/天 |
| + 35 余款模型 | 各不相同 | 各不相同 | 文本 / 图像 | 按等级各不相同 |
Groq 🇺🇸
提供免费套餐,无需信用卡。超快速 LPU 推理。[2]
基础 URL:https://api.groq.com/openai/v1
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| llama-3.3-70b-versatile | 131K | 32K | 文本 | 30 次/分钟,1,000 次/天 |
| llama-3.1-8b-instant | 131K | 131K | 文本 | 30 次/分钟,1,000 次/天 |
| llama-4-scout-17b-16e-instruct | 131K | 8K | 文本 + 视觉 | 30 次/分钟,1,000 次/天 |
| qwen3-32b | 131K | 131K | 文本 | 30 次/分钟,1,000 次/天 |
| gpt-oss-120b | 131K | 32K | 文本 | 30 次/分钟,1,000 次/天 |
Hugging Face 🇺🇸
免费用户每月可获得 10 万次推理服务提供商额度。可路由至 Fireworks、Together、Hyperbolic、Nebius、Novita、DeepInfra 等平台。提供数千种模型。
基础 URL:https://router.huggingface.co/v1
| 模型名称 | 上下文长度 | 最大输出 | 模态类型 | 速率限制 |
|---|---|---|---|---|
| Meta-Llama-3.1-8B-Instruct | 128K | ~4K | 文本 | 按额度计量 |
| gemma-3-4b-it | 131K | ~4K | 文本 | 按额度计量 |
| phi-4 | 128K | ~4K | 文本 | 按额度计量 |
| Qwen2.5-Coder-7B-Instruct | 131K | ~4K | 文本 | 按额度计量 |
| Qwen2.5-7B-Instruct | 131K | ~4K | 文本 | 按额度计量 |
| + 数千种社区模型 | varies | varies | 文本、图像、音频、嵌入 | 每月免费 10 万额度 |
Kilo Code 🇺🇸
提供免费模型,无需信用卡。kilo-auto/free 自动路由会将 80% 请求路由至 minimax/minimax-m2.5:free,20% 请求路由至 stepfun/step-3.5-flash:free。[3]
基础 URL:https://api.kilo.ai/api/gateway
| 模型名称 | 上下文长度 | 最大输出 | 模态类型 | 速率限制 |
|---|---|---|---|---|
x-ai/grok-code-fast-1:free |
256K | — | 文本(代码) | ~200 请求/小时 |
minimax/minimax-m2.5:free |
196K | 8K | 文本 | ~200 请求/小时 |
bytedance-seed/dola-seed-2.0-pro:free |
— | — | 文本 | ~200 请求/小时 |
nvidia/nemotron-3-super-120b-a12b:free |
262K | 32K | 文本 | ~200 请求/小时 |
arcee-ai/trinity-large-thinking:free |
— | — | 文本(推理) | ~200 请求/小时 |
openrouter/free |
varies | varies | 文本 | ~200 请求/小时 |
LLM7.io 🇬🇧
零门槛 API 网关。基础访问无需注册。支持 30+ 模型。符合 GDPR 标准。
基础 URL:https://api.llm7.io/v1
| 模型名称 | 上下文 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| deepseek-r1-0528 | — | — | 文本(推理) | 30 次/分钟(带令牌 120) |
| deepseek-v3-0324 | — | — | 文本 | 30 次/分钟(带令牌 120) |
| gemini-2.5-flash-lite | — | — | 文本 + 视觉 | 30 次/分钟(带令牌 120) |
| gpt-4o-mini | — | — | 文本 + 视觉 | 30 次/分钟(带令牌 120) |
| mistral-small-3.1-24b | 32K | — | 文本 | 30 次/分钟(带令牌 120) |
| qwen2.5-coder-32b | — | — | 文本(代码) | 30 次/分钟(带令牌 120) |
| + ~24 更多模型 | 可变 | 可变 | 文本 | 30 次/分钟(带令牌 120) |
ModelScope 🇨🇳
注册用户可免费使用 API 推理服务。需绑定阿里云账号并完成实名认证。[4]
基础 URL:https://api-inference.modelscope.cn/v1
| 模型名称 | 上下文 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
Qwen/Qwen3.5-35B-A3B |
— | — | 文本 | 总计 2,000 次/天;单模型 ≤500 次/天(动态) |
Qwen/Qwen3.5-27B |
— | — | 文本 | 总计 2,000 次/天;单模型 ≤500 次/天(动态) |
| + 支持 API 推理的模型 | 可变 | 可变 | LLM、MLLM | 动态配额 + 动态并发 |
NVIDIA NIM 🇺🇸
NVIDIA 开发者计划会员可免费使用。支持 100+ 模型。有速率限制(无每日令牌上限)。
基础 URL:https://integrate.api.nvidia.com/v1
| 模型名称 | 上下文 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
deepseek-ai/deepseek-v4-flash |
1M | ~64K | 文本 | ~40 次/分钟 |
nvidia/nemotron-3-super-120b-a12b |
262K | 262K | 文本 | ~40 次/分钟 |
nvidia/nemotron-3-nano-30b-a3b |
128K | 32K | 文本 | ~40 次/分钟 |
nvidia/llama-3.1-nemotron-ultra-253b-v1 |
128K | 4K | 文本 | ~40 次/分钟 |
meta/llama-3.3-70b-instruct |
128K | 4K | 文本 | ~40 次/分钟 |
mistralai/mistral-nemotron |
128K | 8K | 文本 | ~40 次/分钟 |
google/gemma-4-31b-it |
128K | 8K | 文本 | ~40 次/分钟 |
mistralai/mistral-large-2-instruct |
128K | 4K | 文本 | ~40 次/分钟 |
minimax/minimax-m2.7 |
128K | 8K | 文本 | ~40 次/分钟 |
| + 90 更多模型 | 可变 | 可变 | 文本、图像、视频、语音、嵌入 | ~40 次/分钟 |
Ollama Cloud 🇺🇸
免费套餐包含合理的使用限制。Ollama 库提供 400 多种模型。不兼容 OpenAI SDK;使用 Ollama API。[5]
基础 URL:https://api.ollama.com
| 模型名称 | 上下文 | 最大输出量 | 模态 | 速率限制 |
|---|---|---|---|---|
gpt-oss:120b-cloud |
128K | 取决于模型 | 文本 | 会话/每周限制(未公开) |
deepseek-v3.1:671b-cloud |
128K | 取决于模型 | 文本 | 会话/每周限制(未公开) |
qwen3-coder:480b-cloud |
128K | 取决于模型 | 文本(代码) | 会话/每周限制(未公开) |
kimi-k2:1t-cloud |
262K | 取决于模型 | 文本 | 会话/每周限制(未公开) |
glm-4.6:cloud |
128K | 取决于模型 | 文本 | 会话/每周限制(未公开) |
deepseek-r1:cloud |
128K | 取决于模型 | 文本(推理) | 会话/每周限制(未公开) |
| + 30 多种云模型 | varies | varies | 文本 | 会话/每周限制(未公开) |
OpenRouter 🇺🇸
约 22 个免费模型(标有 :free 后缀)。兼容 OpenAI SDK。[6]
基础 URL:https://openrouter.ai/api/v1
| 模型名称 | 上下文 | 最大输出量 | 模态 | 速率限制 |
|---|---|---|---|---|
qwen/qwen3-coder:free |
1M | 262K | 文本(代码) | 20 次/分钟,200 次/天 |
nvidia/nemotron-3-ultra-550b-a55b:free |
1M | 65K | 文本 | 20 次/分钟,200 次/天 |
nvidia/nemotron-3-super-120b-a12b:free |
1M | 262K | 文本 | 20 次/分钟,200 次/天 |
openai/gpt-oss-120b:free |
131K | 131K | 文本 | 20 次/分钟,200 次/天 |
openai/gpt-oss-20b:free |
131K | 8K | 文本 | 20 次/分钟,200 次/天 |
meta-llama/llama-3.3-70b-instruct:free |
131K | ~16K | 文本 | 20 次/分钟,200 次/天 |
nousresearch/hermes-3-llama-3.1-405b:free |
131K | ~16K | 文本 | 20 次/分钟,200 次/天 |
google/gemma-4-31b-it:free |
262K | 32K | 多模态 | 20 次/分钟,200 次/天 |
poolside/laguna-m.1:free |
262K | 32K | 文本 | 20 次/分钟,200 次/天 |
qwen/qwen3-next-80b-a3b-instruct:free |
262K | ~32K | 文本 | 20 次/分钟,200 次/天 |
| + 约 12 个更多免费模型 | varies | varies | 文本 / 图像 | 20 次/分钟,200 次/天 |
OVHcloud AI Endpoints 🇫🇷
免费匿名使用等级(无需 API 密钥,无需注册):每个 IP 每模型 2 次/分钟。20 余款开源权重模型托管于欧盟。兼容 OpenAI SDK。[7]
基础 URL:https://oai.endpoints.kepler.ai.cloud.ovh.net/v1
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| Qwen3.5-397B-A17B | 131K | ~32K | 文本 | 2 次/分钟(匿名) |
| gpt-oss-120b | 128K | ~32K | 文本 | 2 次/分钟(匿名) |
| gpt-oss-20b | 128K | ~8K | 文本 | 2 次/分钟(匿名) |
| Meta-Llama-3_3-70B-Instruct | 131K | ~4K | 文本 | 2 次/分钟(匿名) |
| Qwen3.6-27B | 131K | ~32K | 文本 | 2 次/分钟(匿名) |
| Qwen3.5-9B | 131K | ~8K | 文本 | 2 次/分钟(匿名) |
| Qwen3-32B | 131K | ~32K | 文本 | 2 次/分钟(匿名) |
| Qwen3-Coder-30B-A3B-Instruct | 262K | ~32K | 文本(代码) | 2 次/分钟(匿名) |
| Qwen2.5-VL-72B-Instruct | 128K | ~8K | 文本 + 视觉 | 2 次/分钟(匿名) |
| Mistral-Small-3.2-24B-Instruct | 128K | ~4K | 文本 | 2 次/分钟(匿名) |
| Mistral-Nemo-Instruct-2407 | 128K | ~4K | 文本 | 2 次/分钟(匿名) |
| Mistral-7B-Instruct-v0.3 | 32K | ~4K | 文本 | 2 次/分钟(匿名) |
SambaNova 🇺🇸
免费使用等级,无需信用卡。超快速 RDU 推理。20 次/分钟,20 万 tokens/天。[8]
基础 URL:https://api.sambanova.ai/v1
| 模型名称 | 上下文长度 | 最大输出 | 模态 | 速率限制 |
|---|---|---|---|---|
| DeepSeek-V3.1 | 128K | ~8K | 文本 | 20 次/分钟,20 次/天,20 万 tokens/天 |
| DeepSeek-V3.2 (Preview) | 128K | ~8K | 文本 | 20 次/分钟,20 次/天,20 万 tokens/天 |
| Meta-Llama-3.3-70B-Instruct | 128K | ~8K | 文本 | 20 次/分钟,20 次/天,20 万 tokens/天 |
| gpt-oss-120b | 128K | ~8K | 文本 | 20 次/分钟,20 次/天,20 万 tokens/天 |
| MiniMax-M2.7 | 128K | ~8K | 文本 | 20 次/分钟,20 次/天,20 万 tokens/天 |
| gemma-4-31B-it (Preview) | 128K | ~8K | 文本 | 20 次/分钟,20 次/天,20 万 tokens/天 |
SiliconFlow 🇨🇳
提供永久免费模型,无需信用卡。另有 200 余款付费模型可供选择。
基础 URL:https://api.siliconflow.cn/v1
| 模型名称 | 上下文长度 | 最大输出长度 | 模态 | 速率限制 |
|---|---|---|---|---|
Qwen/Qwen3-8B |
131K | 131K | 文本 | 30 次/分钟,60K tokens/分钟 |
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B |
131K | 可配置 | 文本(推理) | 30 次/分钟,60K tokens/分钟 |
术语表
| 缩写 | 含义 |
|---|---|
| RPM | 每分钟请求数 |
| RPD | 每天请求数 |
| TPM | 每分钟 tokens 数 |
| TPD | 每天 tokens 数 |
| RPS | 每秒请求数 |
贡献指南
知道本列表中缺少的免费套餐吗?提交 PR。请包含服务提供商、端点、速率限制(并链接到其文档)以及一些值得注意的模型。试用 credits 和限时促销活动不在此列。
Groq 的速率限制在 2026 年进行了调整。免费套餐中大多数模型现在的每日请求数为 1,000 次(低于之前的 14,400 次)。Llama 4 Maverick 已被弃用。详见 速率限制。 ↩︎
Kilo Code 的免费模型列表可能会随时间变化。nvidia/nemotron-3-super-120b-a12b:free 仅用于试用——NVIDIA 会记录其提示词。自动路由
kilo-auto/free将请求路由至 minimax/minimax-m2.5:free(80%)和 stepfun/step-3.5-flash:free(20%)。 ↩︎API-Inference 对已注册用户免费。当前公布的限制为每位用户每天 2,000 次请求(所有模型总计),每个模型的每日配额会动态调整,上限为 500 次;并发请求也会受到动态速率限制。需要绑定阿里云账号并进行实名认证(限制说明,介绍)。 ↩︎
Ollama Cloud 通过 GPU 时间而非 tokens 或请求数来衡量使用量。免费套餐被描述为“轻度使用”,会话限制每 5 小时重置一次,每周限制每 7 天重置一次。另有 Pro(50 倍用量)和 Max(250 倍用量)套餐可供选择。不兼容 OpenAI SDK;使用 Ollama API。 ↩︎
免费模型默认每个模型每日 200 次请求。一次性购买 10 美元及以上 credits 可解锁免费模型每日 1,000 次请求。OpenRouter 还提供 免费模型路由(
openrouter/free)和 模型 fallback,用于按优先级顺序链接模型。免费服务提供商可能会记录提示词用于训练。 ↩︎OVHcloud AI Endpoints 提供永久免费的匿名套餐(每 IP 每分钟每模型 2 次请求),无需注册或 API 密钥。更高的速率限制(每个公共云项目每模型 400 次/分钟)需要 API 密钥,并按 token 量按需计费;新的公共云账户可获得高达 200 美元的免费试用 credits。模型托管在欧盟数据中心。 ↩︎
SambaNova 在永久免费套餐的基础上,额外提供 5 美元的初始 credits(有效期 30 天)。免费套餐本身永久有效,每个模型限制为每分钟 20 次请求、每天 20 次请求和每天 200K tokens。无需信用卡。兼容 OpenAI SDK。 ↩︎
Introduction
永久免费的大语言模型 API 列表(API 密钥)😎🔑【此简介由AI生成】