
在大模型推理成本居高不下的今天,如何用最低门槛调用 Llama、DeepSeek、Qwen 等顶级开源模型,是每个开发者都关心的问题。Together AI 是目前最主流的开源模型托管平台之一,提供 200+ 个开源模型的 Serverless 推理 API,并附带免费试用额度,让开发者无需自建 GPU 集群即可快速接入生产级大模型服务。本文将系统讲解 Together AI 的免费额度政策、注册流程、API 调用方法、模型与价格对比,以及中国用户的实际可用性,帮助你快速上手这一免费 AI 算力资源。
一、Together AI 是什么:开源模型 Serverless 推理平台
Together AI(Together Compute Inc.)成立于 2022 年,总部位于旧金山,由开源搜索先驱 Vipul Ved Prakash 联合创立,是一家专注于开源大模型推理与微调的云服务平台。它的核心定位是”开源模型的 AWS”——把 Llama、DeepSeek、Qwen、Mixtral 等社区模型部署在自有的 GPU 集群上,通过统一的 OpenAI 兼容 API 对外提供 Serverless 推理服务。
与 Groq 这类极致低延迟推理平台不同,Together AI 的优势在于模型覆盖面广(200+ 模型)、同时支持对话补全、嵌入向量、图像生成、Rerank 重排序、以及模型微调(Fine-tuning),是一个功能完整的生成式 AI 开发平台。其推理后端基于自研的 Together Inference Engine,针对开源模型做了 FlashAttention、量化、连续批处理等优化,单卡吞吐量可达开源框架的数倍。

二、是否需要绑卡与免费额度详情
1. 是否需要绑卡:注册 Together AI 账号无需绑定信用卡。你可以用 GitHub 或 Google 账号直接登录,系统会自动发放免费试用额度。只有在免费额度用尽、需要继续付费使用时,才需要在 Billing 页面添加支付方式(支持信用卡)。这意味着开发者可以零门槛体验平台上的全部开源模型。
2. 免费额度是多少:新注册账号可获得 $5 美元免费试用额度(Trial Credits)。该额度可用于调用平台上所有付费模型,包括 Llama 3.3 70B、DeepSeek V3 等大参数模型。以 Llama 3.3 70B Turbo 为例,输出端约 $0.88/百万 tokens,$5 额度约可生成 568 万 tokens 的输出,相当于数千次常规对话调用,足够完成功能测试和原型验证。需要注意免费额度有有效期(通常为注册后 14 天),过期未用完将失效。
三、限速、模型列表与可用模型限制
3. 限速与模型限制:Together AI 对免费试用账号施加较低的速率限制,典型配置如下表所示。升级到付费账户后限制会显著放宽,并可申请 Dedicated 专属端点获得无限制吞吐。
| 限制项 | 免费试用账户 | 付费账户(Pay-as-you-go) |
|---|---|---|
| 每分钟请求数(RPM) | 约 1 RPM | 可调至数十至上百 RPM |
| 每分钟 Token 数(TPM) | 有限 | 按套餐提升 |
| 并发请求 | 1 个 | 支持并发 |
| 可用模型 | 全部 200+ 模型 | 全部 + 专属端点 |
| 微调功能 | 可用(消耗额度) | 可用 + 部署专属微调模型 |
可用模型列表(部分热门模型):
| 模型名称 | 参数量 | 类型 |
|---|---|---|
| meta-llama/Llama-3.3-70B-Instruct-Turbo | 70B | 对话/推理 |
| deepseek-ai/DeepSeek-V3 | 671B (MoE) | 对话/推理 |
| Qwen/Qwen2.5-72B-Instruct-Turbo | 72B | 对话/推理 |
| mistralai/Mixtral-8x22B-Instruct-v0.1 | 8x22B (MoE) | 对话/推理 |
| meta-llama/Llama-3.3-8B-Instruct-Turbo | 8B | 轻量对话 |
| blackforestlabs/FLUX.1-schnell | — | 图像生成 |
| WhereIsAI/UAE-Large-V1 | 335M | 嵌入向量 |
可以看到,Together AI 覆盖了从 8B 轻量模型到 671B 超大 MoE 模型的完整矩阵。Turbo 后缀版本经过平台优化,推理速度和性价比更高,是免费额度下的首选。更多模型可在控制台 Models 页面查看完整清单。
四、注册步骤:从零开通 Together AI 账号
4. 注册步骤:整个过程约 2 分钟即可完成,无需信用卡,无需企业认证。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16 # 步骤1:访问官网注册
# 打开 https://www.together.ai
# 点击右上角 Sign In,选择 Continue with GitHub 或 Continue with Google
# 步骤2:获取 API Key
# 登录后进入 Dashboard -> 左侧菜单 Settings -> API Keys
# 点击 Create new key,复制保存 API Key(格式:xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx)
# 建议立即保存到环境变量:
export TOGETHER_API_KEY=你的API密钥
# 步骤3:验证免费额度
# 进入 Dashboard -> Credits 页面确认 5美元试用额度已到账
# 进入 Playground 可直接在网页上测试模型对话
# 步骤4:(可选)安装官方 SDK
pip install together
注册完成后,你就可以在 Playground 中可视化测试模型,或通过 API Key 调用接口。控制台还提供用量统计(Usage)页面,方便实时监控免费额度消耗情况。
五、API 调用示例:curl 与 Python 实战
5. API 调用示例:Together AI 的 Chat Completions 接口完全兼容 OpenAI 格式,迁移成本极低。只需把
1 | base_url |
指向
1 | https://api.together.xyz/v1 |
,即可用现有的 OpenAI 客户端代码直接调用。
1
2
3
4
5
6
7
8
9
10
11
12
13
14 # curl 调用示例:Llama 3.3 70B 对话补全
curl -X POST https://api.together.xyz/v1/chat/completions \
-H "Authorization: Bearer $TOGETHER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "meta-llama/Llama-3.3-70B-Instruct-Turbo",
"messages": [
{"role": "system", "content": "你是一个专业的技术写作助手。"},
{quot;role": "user", "content": "用三句话解释什么是KV Cache。"}
],
"max_tokens": 256,
"temperature": 0.7,
"stream": false
}'
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23 # Python 调用示例(官方 together SDK)
from together import Together
client = Together(api_key="你的API_KEY")
response = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3",
messages=[
{"role": "user", "content": "用Python实现一个简单的LRU缓存。"}
],
max_tokens=512,
temperature=0.7,
)
print(response.choices[0].message.content)
# 流式输出示例
stream = client.chat.completions.create(
model="Qwen/Qwen2.5-72B-Instruct-Turbo",
messages=[{"role": "user", "content": "解释Speculative Decoding原理。"}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")
此外,Together AI 还提供嵌入向量接口(Embeddings)、图像生成接口(Images,基于 FLUX 模型)和重排序接口(Rerank),接口风格同样与 OpenAI 对齐,非常适合构建 RAG 检索增强生成应用。
1
2
3
4
5
6
7
8
9
10 # 嵌入向量调用示例(用于RAG)
from together import Together
client = Together()
resp = client.embeddings.create(
model="WhereIsAI/UAE-Large-V1",
input=["大模型推理优化", "KV Cache原理"],
)
for item in resp.data:
print(f"向量维度: {len(item.embedding)}")
六、额度用完后的费用:按量付费价格表
6. 额度用完后的费用:免费额度耗尽后,Together AI 采用按量付费(Pay-as-you-go)模式,按实际消耗的 Token 数计费,无需预付套餐。以下是部分热门模型的参考价格(每百万 tokens,美元,数据以官方定价页面为准):
| 模型 | 输入($/1M tokens) | 输出($/1M tokens) | 说明 |
|---|---|---|---|
| Llama-3.3-70B-Instruct-Turbo | ≈0.18 | ≈0.88 | Turbo优化版,性价比最高 |
| DeepSeek-V3 | ≈0.27 | ≈1.10 | 671B MoE,推理能力强 |
| Qwen2.5-72B-Instruct-Turbo | ≈0.20 | ≈0.90 | 中文场景表现优秀 |
| Llama-3.3-8B-Instruct-Turbo | ≈0.02 | ≈0.06 | 轻量模型,成本极低 |
| Mixtral-8x22B | ≈0.30 | ≈0.60 | MoE架构,多语言支持 |
| FLUX.1-schnell(图像) | ≈0.003/张 | — | 每张图按次计费 |
可以看出,Together AI 的定价在开源模型托管平台中处于中等偏低水平。8B 级别轻量模型的成本几乎可以忽略,适合高频调用的生产场景;70B+ 大模型单次对话成本约在 $0.001 量级。对于稳定的生产负载,还可以考虑 Dedicated 专属端点,按 GPU 小时计费,获得更低的单 token 成本和更高的吞吐上限。
七、中国用户可用性:访问、延迟与替代方案
7. 中国用户可用性:Together AI 的 API 端点
1 | api.together.xyz |
在国内部分地区可直连,但稳定性一般,高峰期可能出现连接超时或 SSL 握手失败。建议国内开发者采取以下措施:
- 使用代理/VPN:通过海外节点访问,稳定性最佳,延迟约 200-400ms(取决于节点位置)。
- Cloudflare Workers 中转:用 Workers 做一层反代,既解决直连问题,又能隐藏 API Key,参考 Cloudflare Workers AI 免费推理 API 攻略了解 Cloudflare 部署方式。
- 延迟优化:选择美国西海岸或日本节点代理,可把首 token 延迟控制在 300ms 以内;开启
1stream=true
流式输出可显著改善体感延迟。
对比来看,DeepSeek 官方 API 和 SiliconFlow(硅基流动)在国内直连体验更好,但 Together AI 的模型种类更丰富,尤其是非国产开源模型(Llama、Mixtral)的首发支持。如果你的应用主要面向国内用户,建议将 Together AI 作为备用通道,配合国内可直连的服务做负载均衡。
八、同类服务横向对比:绑卡、额度、限速与速度
9. 同类服务对比:下表将 Together AI 与其他主流免费推理 API 平台进行横向对比,方便你按需选择。更全面的对比可参考2026年免费 AI 推理 API 横向对比评测。
| 平台 | 需绑卡 | 免费额度 | 代表模型 | 中国可用性 | 核心优势 |
|---|---|---|---|---|---|
| Together AI | 否 | $5 试用 | Llama 3.3、DeepSeek V3 | 需代理 | 模型最全,支持微调 |
| Groq | 否 | 免费层(无明确额度) | Llama 3.3、Mixtral | 需代理 | 超低延迟(LPU架构) |
| Cerebras | 否 | 免费层 | Llama 3.1、Qwen | 需代理 | 极速推理(Wafer引擎) |
| DeepSeek API | 否 | 赠送 tokens | DeepSeek V3/R1 | 直连 | 国产模型,中文最佳 |
| SiliconFlow | 否 | ¥14 额度 | Qwen、DeepSeek、GLM | 直连 | 国内直连,模型丰富 |
| OpenRouter | 否 | 部分免费模型 | 300+ 统一接入 | 需代理 | 统一网关,聚合多平台 |
8. 最近一次验证日期:本文信息验证于 2026 年 9 月 29 日。免费额度政策、模型列表和定价可能随时调整,建议以 Together AI 官网(together.ai)最新公告为准。
九、实战场景:用免费额度搭建一个 RAG 知识问答
最后,我们用一个完整的小项目展示如何把 Together AI 的免费额度用起来——构建一个基于 Llama 3.3 70B 的简易 RAG 问答系统。这个项目综合用到了 Chat Completions、Embeddings 两个接口,单次问答成本极低,$5 免费额度足以支撑数千次问答。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40 import os, json
from together import Together
client = Together(api_key=os.environ["TOGETHER_API_KEY"])
# 1. 构建知识库(演示用,实际可用文档分块)
knowledge = [
"KV Cache 缓存了注意力机制中的 Key 和 Value 矩阵,避免重复计算。",
"PagedAttention 把 KV Cache 分成固定大小的页,按需分配显存。",
"Continuous Batching 在同一批次内动态加入新请求,提高 GPU 利用率。",
]
# 2. 生成嵌入向量
embs = client.embeddings.create(
model="WhereIsAI/UAE-Large-V1", input=knowledge
)
kb_vectors = [d.embedding for d in embs.data]
# 3. 简单余弦相似度检索
def retrieve(query, top_k=1):
q_emb = client.embeddings.create(
model="WhereIsAI/UAE-Large-V1", input=[query]
).data[0].embedding
scores = [
sum(a*b for a, b in zip(q_emb, v)) for v in kb_vectors
]
idx = sorted(range(len(scores)), key=lambda i: -scores[i])[:top_k]
return [knowledge[i] for i in idx]
# 4. 带检索上下文的问答
context = "\n".join(retrieve("什么是PagedAttention?"))
resp = client.chat.completions.create(
model="meta-llama/Llama-3.3-70B-Instruct-Turbo",
messages=[
{"role": "system", "content": f"根据以下资料回答问题:{context}"},
{"role": "user", "content": "什么是PagedAttention?"},
],
max_tokens=256,
)
print(resp.choices[0].message.content)
这段代码展示了 Together AI 在 RAG 场景的完整链路:用 UAE-Large-V1 生成文档与查询的嵌入向量做检索,再把检索结果作为上下文交给 Llama 3.3 70B 生成回答。整个流程消耗的免费额度极小,是验证 AI 应用原型的理想方案。
总结:Together AI 适合谁用
综合来看,Together AI 的免费 $5 额度 + 200+ 开源模型 + 免绑卡注册的组合,非常适合以下场景:开源模型选型测试(横向对比 Llama/DeepSeek/Qwen 效果)、RAG 与 Agent 原型开发、微调模型的小规模验证、以及学习大模型 API 调用。需要注意的局限是:免费额度有限且有时效,国内访问需要代理,免费层速率限制较低不适合高并发。
如果你需要国内直连、长期免费且高并发的方案,建议把 Together AI 与 DeepSeek 官方 API、SiliconFlow 等国内可用平台组合使用——Together AI 负责非国产开源模型的调用,国内平台负责高频中文场景,形成互补的混合推理架构。掌握 Together AI 的使用,等于拿到了一把打开 200+ 开源大模型的钥匙,对 AI 工程化能力的提升大有裨益。
汤不热吧