ARTICLE · 1158453
AI Builder:小模型通用训练Harness系统
做了一个通用模型训练 Agent:用户说出想解决的问题,Agent 帮他选办法、准备数据和模型、运行训练,再交付能试用、能保存的结果。
“用我的声音读文章”“识别票据”“预测下周销量”,都可以是起点。模型和方法会变,准备材料、做实验、检查效果和交付的过程可以共用。

一、为什么做这个产品
相近方向已有开源实践:MLZero做多模态机器学习自动化,AIDE根据目标和指标改进代码,FT-Agent把训练配置和评估反馈接起来。
我们把建设重点放在三个地方:
- 从场景开始。
用户不必先说清模型名和参数,Agent 理解目标后,解释可选办法和准备要求。 - 按任务自动构建。
根据目标、数据和资源,复用已有模型与工具,生成或调整训练、评估和预测代码,试跑验证后推进训练。 - 交付能继续用的结果。
用户能查看评估、试用新输入、下载模型,并找到之前的实验。
通用性是建设方向,实际已验证的范围放在文末。

二、架构:让建议变成实际训练
工作台负责操作,Agent 运行时组织行动,训练服务保存事实并调度执行。 工作台通过后台 API 提交操作、读取结果;运行时(Harness)负责上下文、模型和工具调用。

训练服务核对数据、代码版本。新代码先形成执行包,声明训练、评估、预测和环境要求;完成受限环境的资格检查并获准后,才能启用和正式训练。通用新代码走隔离环境,已有受信程序沿用既有执行方式。
智能体的构建,围绕角色规则、工具和上下文。 协调 Agent 按需把任务与材料交给专家,再综合结果;每个角色有自己的指令和工具范围。

工具结果回填上下文,Agent 据此继续。任务记忆保留目标与选择,由协调 Agent 经工具读写,并引用用户原话;正式版本、运行和批准仍由训练服务核对。跨任务的长期记忆待扩展。
三、我们怎样组织 AI 开发
之前的LearnBuddy 的实战里,我们整理过一条方法:每一步的产物,成为下一步交给 AI 的输入。 这次把需求、技术、视觉、开发和评测五类规范,作为每轮任务的共同约束。

需求、架构和设计可以由 AI 起草,人确认方向、范围和标准。把这些材料与当前代码、任务记录一起交给 Codex,它在单轮任务内实现、检查,根据失败证据修复,再复验。人检查结果,决定接受还是继续调整。
前期为了简化交互和视觉设计,直接用 Codex 操作 WorkBuddy 模型模型训练交互,然后截图workbuddy相关的交互和视觉效果,再反向提炼了视觉和设计规范。

我们按“场景到方案”“方案到实验”“实验到交付”拆任务,每轮同时接页面和后台。给 Codex 的任务可以这样写:
这轮让用户做到:……先读需求、设计、架构和当前代码,找出缺口。按一条完整路径实现,检查正常与失败情况。失败时保留证据,修复后重走原案例并补相邻情况。交付代码、测试、操作记录及仍未验证的部分。稳定规则放进 AGENTS.md;当前任务、决定和检查结果单独记录,供下一轮继续。Codex 是开发助手,产品内的 Agent 是用户的训练助手。
四、验收:对话顺不顺,结果能不能用
从场景开始,就让测试者像小白一样说话。 用“我不懂模型”“你帮我选”“先别训练”开场,途中改口、补材料、追问术语。检查回复是否有帮助、是否重复提问,后台是否遵守最新选择。
自动构建,就给 Agent 一个没有现成方案的任务。 通过页面交目标和材料,核对代码准备、试跑、训练与产物;已有方案也检查复用是否合适。错文件、超时、重复提交、停止和刷新后,要能找到准确进度与继续方式。
交付结果,就真的试用落地。 训练和调优用训练集、验证集,独立测试再检查质量。执行代码计算指标,验收程序按已确认的标准核对效果、测试样本、污染与文件完整性。语音任务还要试听。
输入新样本,确认结果来自指定模型;下载模型包,在新环境按说明重新加载。打包时的文件校验与下载后的重载验证分别检查。版本改变后,旧检查和批准也要重新核对。

模拟用户只根据自己的场景、材料和可见回复继续,后台供事后核对。AI 可以帮助评审对话与截图,判断标准先用人工看过的正反例核对。
验收分别报告流程走通、模型达标、下载包可用。训练完成不等于质量达标;清单说明准备测什么,有实际记录才能说已通过。
五、现在做到哪,下一步补什么
项目已发布 rc.2 开发者源码预览。发布回执记录了合成表格回归和搜索排序两个页面任务,完成实验、新输入和模型包重新加载。目前实测的是本地 CPU,以及发布记录中使用的对话模型服务。
后续先补齐跨实验预算、失败追溯和训练中断恢复,再扩展环境准备、远程 GPU 与其他模型服务的实测。

开源仓库(可复制到浏览器,欢迎试用和 Star):
https://github.com/wanghui2323/specialist-model-studio
安装与运行说明:
https://github.com/wanghui2323/specialist-model-studio/blob/main/docs/v1.0-source-release-candidate.md