训练模型这件事,最容易让人误会的一点是:好像只要代码能跑起来,剩下就是等结果。
但真跑过几轮就知道,麻烦往往不在“开始训练”,而在训练之后。
这次 loss 降得更快,是因为学习率改了,还是数据清洗起作用了?昨天那组参数到底是多少?跑在另一台机器上的日志放哪了?显存飙升是偶然,还是某个 batch 开始就不对劲?
实验一多,最怕的不是指标不好看,而是最后只剩一句:我记得好像有一版更好。

官方 README 里的 SwanLab 总览图:训练指标、实验信息和可视化看板集中在一个页面里。
今天这个项目叫 SwanLab。
它做的事可以说得很直白:把 AI 训练过程变成一块可追踪、可对比、可分享的看板。
先把训练过程看清楚
平时训练时,我们会记录 loss、accuracy、学习率、样本图、文本结果、硬件状态这些东西。
如果只是一次小实验,随便打点日志也能凑合。
但一旦开始微调大模型、跑多组超参、或者多人一起做同一个项目,日志文件就很快变成一堆散落的碎片。
SwanLab 的价值就在这里:把这些碎片收进同一个项目里,让你先看到全局,再去追细节。
对比实验会舒服很多
真正做模型迭代时,很少有人只关心一条曲线。
更常见的问题是:这几次实验谁更好?差异来自哪里?哪组参数值得继续放大?

官方 README 里的实验表格视图:适合把多次训练放在一起筛选、排序和比较。
这种表格视图很实用。
它不是为了把数据摆得漂亮,而是为了让你少做一点“翻日志、找文件、问同事”的重复动作。
一组实验的参数、指标和结果能放在一起看,复盘速度会明显不一样。
它对国内训练环境也比较友好
SwanLab 不只是支持常见的 PyTorch、Transformers、LLaMA Factory、ms-swift、Ultralytics、MMEngine、Keras 这些框架。
它在硬件记录上也列出了不少国内环境会遇到的设备,比如昇腾、寒武纪、昆仑芯、摩尔线程、沐曦、天数智芯、海光 DCU 等。

官方 README 里的框架集成图:更像训练过程旁边的一层记录基础设施。
这点对很多团队其实挺关键。
因为不是所有训练都发生在一台本地电脑上,也不是所有团队都方便把数据丢到外部平台。
SwanLab 支持云端,也支持自托管。对实验室、企业内网、离线训练环境来说,这个选择空间会更踏实。
我会把它放进训练工具箱
这个项目不是那种看一眼就“哇”的玩具。
它更像一个训练过程里的记账本和仪表盘:平时不显眼,但一旦实验多起来,你会很希望所有东西都有迹可循。
如果你经常微调模型、跑对比实验,或者和别人一起维护训练项目,SwanLab 值得放进收藏夹里试一下。
它解决的不是“怎么把模型训好”这个大问题,而是一个更具体的小问题:让每一次训练都别白跑,别丢,别只靠记忆复盘。
官网:https://swanlab.cn
GitHub:https://github.com/SwanHubX/SwanLab
夜雨聆风