在深度学习开发中,本地 GPU 资源往往捉襟见肘:显存不够、驱动版本冲突、CUDA 环境配置繁琐。Lightning AI Studio(前身为 PyTorch Lightning Grid)提供了一个完全运行在浏览器中的云端 GPU 开发环境,并且对个人开发者开放了相当慷慨的免费额度。本文将完整介绍 Lightning AI Studio 的免费套餐、注册流程、Studio 创建、GPU 训练实战、数据持久化以及与同类平台的横向对比,帮助你零成本启动下一个 AI 项目。

一、Lightning AI Studio 是什么
Lightning AI Studio 是 Lightning AI 公司推出的云端 AI 开发平台,其核心产品 PyTorch Lightning 已成为全球数十万研究者和工程师的首选训练框架。Studio 将 PyTorch Lightning 的开发体验延伸到云端:每个 Studio 都是一个完整的、持久化的云端工作空间,内置 JupyterLab、VS Code Server、终端、文件浏览器以及预装好的 PyTorch / TorchVision / Transformers 等深度学习栈。
与传统的云端 Jupyter(如 Colab)相比,Studio 的最大特点是持久化:你创建的环境、安装的 pip 包、上传的数据集、训练的 checkpoint 都会长期保留,下次打开时直接续上,无需从头配置。这意味着你可以把它当作一个「永远在线、随取随用」的远程 GPU 工作站。
核心特性一览
- 预置 GPU 实例:支持从免费 CPU 到 NVIDIA T4、A10G、A100 等多种 GPU 规格,按需切换。
- 持久化存储:Studio 环境与文件长期保存,关闭后可随时恢复,无需重复配置。
- 内置协作:支持多人实时协作编辑同一个 Studio,适合团队教学与远程结对编程。
- 一键部署:训练完成的模型可以一键发布为 Lightning App,对外提供推理 API 或 Web 界面。
- 深度集成 PyTorch Lightning:对 Lightning 框架原生支持,训练日志、checkpoint、early stopping 等开箱即用。
二、免费套餐详解
Lightning AI 对个人开发者提供持续的免费额度,无需绑定信用卡即可注册使用。免费套餐的核心权益如下:
| 项目 | 免费额度 | 说明 |
|---|---|---|
| 每月连续 GPU 时间 | 22 小时(T4 GPU) | 每月自动重置,可拆分多次使用 |
| 每月 CPU 时间 | 不限(有限并发) | 后台运行有更严格限制 |
| 持久化存储 | 10 GB | 所有 Studio 共享,包含数据与 checkpoint |
| 并发 Studio 数 | 1 个运行中 | 可创建多个,但同时只能运行一个 |
| 团队协作 | 支持 | 可邀请他人查看/编辑你的 Studio |
需要注意的是,22 小时的 GPU 时间是「连续运行时长」的概念——只要你不在使用时及时停止 Studio(点击 Stop 而非最小化),就不会持续消耗额度。合理利用这一点,22 小时足够完成多次中小型训练任务。存储空间方面,10 GB 对于存放代码、小型数据集和模型 checkpoint 绰绰有余;如果需要训练大模型,可以将数据放在外部对象存储(如 GCS、S3)按需拉取。

三、注册与环境搭建
1. 账号注册
访问
1 | lightning.ai |
,点击 Sign Up,使用 Google 或 GitHub 账号一键登录,或使用邮箱注册。注册过程无需信用卡,几秒钟内即可完成。新用户首次登录后会进入一个引导式的 onboarding Studio,帮助你熟悉界面操作。
2. 创建第一个 Studio
登录后点击右上角 + Create Studio,进入创建向导。关键配置项如下:
- Studio 名称:建议用项目语义命名,如
1mnist-cnn-demo
。
- 机器类型(Machine):开发阶段选
1CPU
或
1T4 GPU(免费额度内),训练阶段切换到 GPU。
- 环境模板(Template):提供 PyTorch、Transformers、Stable Diffusion 等预置环境,也可选择 Blank 自定义。
- 存储(Storage):默认挂载 10 GB 持久卷,无需手动配置。
点击 Create 后,Studio 会在约 30 秒内拉起一个完整的云端环境。界面布局类似 JupyterLab:左侧文件浏览器,中间 Notebook / VS Code 编辑区,底部终端。所有改动都会实时持久化到你的存储卷中。
3. 切换 GPU 与按需启停
Studio 默认以 CPU 模式启动以节省额度。当你准备开始训练时,点击右上角机器类型下拉菜单,选择
1 | T4 GPU |
并确认。切换过程会重启内核(约 1 分钟),之后即可使用 GPU。训练完成后务必点击 Stop 完全停止 Studio——仅关闭浏览器标签页不会释放额度。养成「用完即停」的习惯,是最大化利用免费额度的关键。
四、GPU 训练实战:从零训练一个图像分类模型
下面演示一个完整流程:在 Studio 中使用 PyTorch Lightning 训练一个 CIFAR-10 图像分类 CNN 模型,并保存 checkpoint。假设你已创建一个使用 PyTorch Lightning 模板的 Studio 并切换到 T4 GPU。
1. 安装依赖
在 Studio 终端中执行:
1 pip install -q lightning torch torchvision torchmetrics
PyTorch Lightning 模板已预装大部分依赖,这里仅作版本对齐。
2. 训练脚本 train.py
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63 import lightning as L
import torch
import torch.nn as nn
import torch.nn.functional as F
from torch.utils.data import DataLoader
from torchvision import datasets, transforms
from torchmetrics.classification import Accuracy
class CIFARModule(L.LightningModule):
def __init__(self, lr=1e-3):
super().__init__()
self.save_hyperparameters()
self.model = nn.Sequential(
nn.Conv2d(3, 32, 3, padding=1), nn.ReLU(), nn.MaxPool2d(2),
nn.Conv2d(32, 64, 3, padding=1), nn.ReLU(), nn.MaxPool2d(2),
nn.Conv2d(64, 128, 3, padding=1), nn.ReLU(), nn.MaxPool2d(2),
nn.Flatten(),
nn.Linear(128 * 4 * 4, 256), nn.ReLU(),
nn.Linear(256, 10),
)
self.acc = Accuracy(task="multiclass", num_classes=10)
def forward(self, x):
return self.model(x)
def training_step(self, batch, batch_idx):
x, y = batch
logits = self(x)
loss = F.cross_entropy(logits, y)
self.log("train_loss", loss, prog_bar=True)
self.log("train_acc", self.acc(logits, y), prog_bar=True)
return loss
def validation_step(self, batch, batch_idx):
x, y = batch
logits = self(x)
loss = F.cross_entropy(logits, y)
self.log("val_loss", loss, prog_bar=True)
self.log("val_acc", self.acc(logits, y), prog_bar=True)
def configure_optimizers(self):
return torch.optim.Adam(self.parameters(), lr=self.hparams.lr)
transform = transforms.Compose([
transforms.ToTensor(),
transforms.Normalize((0.5, 0.5, 0.5), (0.5, 0.5, 0.5)),
])
train_set = datasets.CIFAR10("./data", train=True, download=True, transform=transform)
val_set = datasets.CIFAR10("./data", train=False, download=True, transform=transform)
train_loader = DataLoader(train_set, batch_size=128, shuffle=True, num_workers=4)
val_loader = DataLoader(val_set, batch_size=256, num_workers=4)
trainer = L.Trainer(
max_epochs=20,
accelerator="auto",
devices=1,
default_root_dir="./checkpoints",
)
model = CIFARModule()
trainer.fit(model, train_loader, val_loader)
3. 运行训练
1 python train.py
T4 GPU 上 20 个 epoch 大约需要 8–12 分钟。训练过程中 Studio 内置的 TensorBoard / Lightning Dashboard 会实时绘制 loss 与 accuracy 曲线。训练结束后 checkpoint 保存在
1 | ./checkpoints/lightning_logs/ |
下,下次打开 Studio 仍可直接加载续训。
4. 加载 checkpoint 续训
1
2
3
4 ckpt_path = "./checkpoints/lightning_logs/version_0/checkpoints/epoch=19.ckpt"
trainer = L.Trainer(max_epochs=40, accelerator="auto", devices=1)
model = CIFARModule.load_from_checkpoint(ckpt_path)
trainer.fit(model, train_loader, val_loader, ckpt_path=ckpt_path)
这就是持久化存储的价值——关闭浏览器、隔几天再回来,环境与数据原封不动。

五、数据持久化与团队协作
持久化存储策略
Studio 的 10 GB 存储是跨会话保留的,但需要注意几个边界:
- 不要在 /tmp 写重要文件:重启后
1/tmp
会被清空,持久数据务必放在
1/teamspace/storage或项目根目录。
- 大型数据集外置:超过 5 GB 的数据集建议放在 Google Cloud Storage 或 HuggingFace Datasets,训练时用流式加载,避免占满存储配额。
- checkpoint 清理:训练多个版本时定期删除旧的 lightning_logs 版本,每个 checkpoint 可能几百 MB。
团队协作
点击 Studio 右上角的 Share 按钮,输入协作者邮箱即可邀请。协作者可以以 Viewer(只读)或 Editor(可编辑)身份加入,多人可同时编辑同一 Notebook,类似 Google Docs 的实时协作体验。这在远程结对调试、教学辅导场景下非常实用——导师可以实时看到学生的代码与训练曲线,直接在同一个环境里改代码。
六、与其他免费算力平台横向对比
| 平台 | 免费 GPU | 持久化 | 协作 | 适合场景 |
|---|---|---|---|---|
| Lightning AI Studio | 22h/月 T4 | 是 10 GB | 是 实时 | PyTorch 开发、教学、中小模型训练 |
| Google Colab | 动态分配 T4 | 否 需手动保存到 Drive | 否 | 临时实验、快速原型 |
| Kaggle Notebooks | 30h/周 T4×2 | 是 有限 20 GB | 否 | 竞赛、数据探索 |
| HuggingFace Spaces | 免费 CPU / 限时 GPU | 是 | 是 | 模型 demo 部署、推理服务 |
| Gradient (Paperspace) | 免费 Notebook GPU | 是 5 GB | 否 | GPU Notebook 实验 |
从对比可以看出,Lightning AI Studio 的核心优势在于「持久化 + 协作 + PyTorch 原生」三位一体。Colab 灵活但不持久,Kaggle 算力充足但协作弱,HF Spaces 偏部署而非开发。如果你主要在 PyTorch 生态工作且希望有一个稳定可回溯的云端工作站,Studio 是免费方案中的优选。
七、常见问题与避坑指南
Q1:免费额度用完了怎么办?
额度每月自动重置。若当月用尽,可切换到 CPU 模式继续做数据预处理、代码开发、可视化等不依赖 GPU 的工作。若长期需要更多 GPU,可升级到 Pro 套餐(约 $15/月)获得更多 GPU 小时与存储。
Q2:Studio 长时间空闲会自动停止吗?
会。Studio 默认空闲 30 分钟自动停止以节省额度,可在设置中调整自动停止阈值。注意「停止」不等于「删除」,停止后所有文件与配置仍保留,重新 Start 即可恢复。
Q3:能否后台运行长任务?
免费套餐的 Studio 不支持后台持续运行——一旦停止 Studio,所有进程都会被杀死。若需要训练几十小时的大模型,免费额度并不适合,建议使用 Modal、RunPod 等按量付费平台,或升级到 Lightning AI 付费套餐启用 Background Runs。
Q4:训练中断了数据会丢吗?
不会。所有写入
1 | /teamspace/storage |
的文件都是持久化的。但训练过程中的临时变量、未保存的 Notebook 单元输出会随内核重启丢失。建议在训练脚本中每 N 个 epoch 调用
1 | trainer.save_checkpoint() |
或使用 ModelCheckpoint 回调,保证可断点续训。
Q5:能不能自定义 CUDA / PyTorch 版本?
可以。Studio 基于官方 PyTorch Docker 镜像,可在终端通过 pip / conda 自由升级或降级 PyTorch、CUDA toolkit(仅运行时库)。但底层驱动版本由平台统一管理,无法更换 NVIDIA driver。一般而言,平台预置的驱动足够支撑最新几个版本的 PyTorch。
八、总结
Lightning AI Studio 把「开箱即用的云端 GPU 开发环境」这件事做到了免费用户也能长期使用的程度。22 小时/月的 T4 GPU、10 GB 持久存储、实时协作、与 PyTorch Lightning 的深度集成,使它成为个人开发者、学生、研究者搭建 AI 工作流的优质免费选项。配合良好的使用习惯——及时停止 Studio、外置大数据集、定期清理 checkpoint——你完全可以在不花一分钱的情况下完成从原型验证到模型训练的完整闭环。
如果你的工作以 PyTorch 为主,且厌倦了反复配置本地 CUDA 环境,不妨把下一个项目搬到 Lightning AI Studio 上试试。免费、持久、可协作——这三个特性组合在一起,在当前的免费算力生态中并不多见。
汤不热吧