
01
PART
数据策略:想清楚后要教什么,用什么数据教
STRATEGY
恋爱机器人上线之前,数据策略负责人要回答一个问题:一个好的恋爱对象应该具备什么能力?共情、主动关心、记住对方说过的话、处理冲突、适度幽默、知道什么时候该给空间。
这些能力不是基座模型自带的,是后训练教出来的。那教这些能力需要什么数据?共情能力,可能需要心理咨询师的真实案例;主动关心,需要的是连续几天的对话样本,不是单轮的;冲突处理,需要吵架后和好的完整过程数据。
数据策略负责人要跟心理学家、婚恋咨询师聊,搞清楚“一段好的关系”长什么样,然后把它翻译成后训练的数据需求——要多少条、什么格式、覆盖哪些场景、标注标准是什么。
上线之后呢?看用户反馈,找模型哪里还不行,定义下一轮后训练要补什么。比如发现机器人不会主动找用户聊天,那就要准备“主动发起对话”的训练数据,做新一轮微调。
这个岗位要的人不太需要写代码,但他得同时懂两件事:什么是好的亲密关系,以及后训练能消化什么形式的数据。能同时想清楚这两件事的人不多。

02
PART
数据工程:把训练数据搬过来,洗干净,管好
ENGINEERING
策略定了,需要一万段安慰场景的对话、五千段冲突处理案例、三个月连续互动的样本。这些数据从哪来?用户真实聊天记录要脱敏,心理咨询师案例得谈版权,人工编剧写的情境对话要控制质量,从小说和影视剧里提取的素材需要标注和清洗。每种来源格式不一样,有的还是音频要转文字。
数据工程师搭的是一条管道,让数据稳定地流进来、洗干净、统一格式、存好,随时能取给训练用。后训练一旦跑起来,每隔一段时间就要喂新数据进去,这条管道不能断。断了就等于这一轮优化停了。
这活儿看着不起眼,但管道一出问题,整个优化流程都得等。

03
PART
数据标注与质量:产出偏好数据,直接决定后训练的效果
ANNOTATION
数据有了,还不能直接喂给模型。得先加工成模型能学的形式。
现在的后训练,尤其是偏好优化(比如 RLHF、DPO),需要的不只是“这是什么”的标签,而是“哪个更好”的判断。这个判断是标注员做的。
用户说“我今天被领导骂了”。
回应 A:“别在意,领导都那样。”
回应 B:“发生什么事了?”
回应 C:“被当众骂还是私下说的?你现在还好吗?”
标注员判断 C 最好。这条偏好数据直接进后训练——模型通过学这些偏好来调整自己的回应方式。标注质量越高,后训练的效果就越好。
标注员做的事情,本质上是把自己对关系的理解编码成模型能学的数据。他不只是在标注,是在判断什么样的话让人舒服。这种判断需要你真的懂人。
数据标注与质量负责人要管的,是让整个团队做出一致的、高质量的判断。他要定义“好的恋爱回应”的标准,培训标注员,抽检质量。这个人的核心能力是懂人。

04
PART
AI 评测:后训练完了,验证模型到底有没有变好
EVALUATION
后训练跑完了,模型更新了一版。变好了吗?变差了?得测。
但测什么?不是考它知不知道情人节是几号,是考它会不会在你不开心的时候说出让你舒服的话。
评测负责人要设计一套体系。给机器人一千个场景,看真人觉得回应舒不舒服;让它跟一百个用户聊一周,看留存率;专门设计吵架场景,看它能不能把冲突化解掉;测长期记忆,看它记不记得你上个月提过的事。
评测结果直接决定这版模型能不能上线。测出来变好了,部署;变差了,回去调数据重新训。没有好的评测,后训练就是在盲飞——你不知道每一步走得对不对。
这个岗位要把“好的恋爱关系”这个特别主观的东西,变成一套能打分的指标。既要懂评测方法,也要懂关系学。

05
PART
用户建模:模型部署到线上之后,让它越来越懂每一个人
USER MODELING
前面四个岗位解决的是让模型“会谈恋爱”。这第五个,解决的是模型部署之后“会跟你谈恋爱”。
同一个模型部署上线了,张三喜欢被撒娇,李四需要空间感,王五吃幽默那一套。不可能给每个人单独训一个模型——成本太高。实际做法是在部署的模型外面叠一层个人记忆系统。
这层系统记录你的性格、沟通习惯、情绪触发点、重要经历。每次聊完更新一次。你上次因为它说“你想太多了”生气了,它记住,下次换个说法。这不是重新训练模型,是在推理阶段做个性化适配——让同一个模型在不同人身上表现出不同的行为。
用户建模负责人就是设计这套系统的人。他横跨数据科学和心理学,做的事情说到底就是一件事:怎么让部署后的模型理解一个具体的人。

06
PART
五个岗位串起来,就是一条完整的模型优化飞轮
FLYWHEEL
数据策略想清楚后训练要教什么、用什么数据 → 数据工程师把训练数据准备好 → 标注团队产出偏好数据,决定后训练学什么方向 → 后训练更新模型 → 评测团队验证这版模型好不好,能不能上线 → 上线部署后,用户建模让模型适应每个人 → 线上新产生的数据反馈给数据策略,进入下一轮后训练。
每一轮,模型都比上一版更懂你一点。数据在推着模型往前走,模型的效果又反过来决定下一轮数据要往哪个方向找。
///
LAST
写在最后
WHY IT MATTERS
这几个岗位有个共同特点:它们要的是“懂人”的能力。数据策略得懂关系才能想清楚教什么,标注得懂情感才能判断好坏,评测得懂亲密关系才能设计考题,用户建模得懂心理才能理解个体差异。
技术可以学,但“懂人”这件事需要阅历。这几个岗位做的是后训练和模型优化里最难替代的那部分——不是调参数,是判断什么是对的、什么是好的。这恰恰是它们重要的原因。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING
夜雨聆风