乐于分享
好东西不私藏

这个国产开源工具,把 AI 训练过程变成看板

这个国产开源工具,把 AI 训练过程变成看板

训练模型这件事,最容易让人误会的一点是:好像只要代码能跑起来,剩下就是等结果。

但真跑过几轮就知道,麻烦往往不在“开始训练”,而在训练之后。

这次 loss 降得更快,是因为学习率改了,还是数据清洗起作用了?昨天那组参数到底是多少?跑在另一台机器上的日志放哪了?显存飙升是偶然,还是某个 batch 开始就不对劲?

实验一多,最怕的不是指标不好看,而是最后只剩一句:我记得好像有一版更好。

官方 README 里的 SwanLab 总览图:训练指标、实验信息和可视化看板集中在一个页面里。

今天这个项目叫 SwanLab

它做的事可以说得很直白:把 AI 训练过程变成一块可追踪、可对比、可分享的看板

先把训练过程看清楚

平时训练时,我们会记录 loss、accuracy、学习率、样本图、文本结果、硬件状态这些东西。

如果只是一次小实验,随便打点日志也能凑合。

但一旦开始微调大模型、跑多组超参、或者多人一起做同一个项目,日志文件就很快变成一堆散落的碎片。

SwanLab 的价值就在这里:把这些碎片收进同一个项目里,让你先看到全局,再去追细节。

对比实验会舒服很多

真正做模型迭代时,很少有人只关心一条曲线。

更常见的问题是:这几次实验谁更好?差异来自哪里?哪组参数值得继续放大?

官方 README 里的实验表格视图:适合把多次训练放在一起筛选、排序和比较。

这种表格视图很实用。

它不是为了把数据摆得漂亮,而是为了让你少做一点“翻日志、找文件、问同事”的重复动作。

一组实验的参数、指标和结果能放在一起看,复盘速度会明显不一样。

它对国内训练环境也比较友好

SwanLab 不只是支持常见的 PyTorch、Transformers、LLaMA Factory、ms-swift、Ultralytics、MMEngine、Keras 这些框架。

它在硬件记录上也列出了不少国内环境会遇到的设备,比如昇腾、寒武纪、昆仑芯、摩尔线程、沐曦、天数智芯、海光 DCU 等。

官方 README 里的框架集成图:更像训练过程旁边的一层记录基础设施。

这点对很多团队其实挺关键。

因为不是所有训练都发生在一台本地电脑上,也不是所有团队都方便把数据丢到外部平台。

SwanLab 支持云端,也支持自托管。对实验室、企业内网、离线训练环境来说,这个选择空间会更踏实。

我会把它放进训练工具箱

这个项目不是那种看一眼就“哇”的玩具。

它更像一个训练过程里的记账本和仪表盘:平时不显眼,但一旦实验多起来,你会很希望所有东西都有迹可循。

如果你经常微调模型、跑对比实验,或者和别人一起维护训练项目,SwanLab 值得放进收藏夹里试一下。

它解决的不是“怎么把模型训好”这个大问题,而是一个更具体的小问题:让每一次训练都别白跑,别丢,别只靠记忆复盘。

官网:https://swanlab.cn

GitHub:https://github.com/SwanHubX/SwanLab