一个人和 AI 合作久了,会更清楚人到底差在哪里不教知识,只进化大脑。我是梁涛,在AI 时代,陪你拿回人类的"定义权"。新趋势·易我测评成长系统创始人。
1997 年卡斯帕罗夫被深蓝击败那场比赛之后,他做了两件事。 第二件,他开始研究一个比"哪一步棋走错了"更基础的问题:人跟机器合作,到底在合作什么? 他后来写《深度思考》,核心结论不是"机器强",是"分工清楚比工具强更重要"。分工清楚,人加机器强于单独的人;分工糊了,人加机器比人还糟——人会被机器的流畅性带偏。 我研发测评小程序,跟 AI 合作了一年。一年下来我承认一件事:AI 让我变强的部分没我想象的多,让我更清楚自己"哪里差"的部分比我想象的多。 "哪里差"不是差在打字速度,是差在三件更不浪漫的事: 清楚,不舒服;不清楚,才舒服地外包。外包久了,会把"流畅"当成"正确",把"生成"当成"完成",直到测试红灯或用户流失,才想起问责还在人这边。问责不能编译进模型,只能留给人——留给人,意味着你要建验收,不能只建提示词。 AI 强在哪里,人不必恋战 AI 强在:海量模式匹配、快速草稿、多版本并行、记忆检索、格式转换、24 小时不疲劳。这些,人应放手,别用自尊心硬扛。 我研发测评小程序,让 AI 写样板代码(boilerplate)、写测试骨架、写文档初稿——省下的时间,用在边界定义、验收、用户路径、伦理取舍。取舍是人岗;生成是机岗。岗混了,两边都低效:人跟机器比速度,机器跟人比判断,都比错赛道。 恋战在 AI 强项里,人会变成慢速低配版,还累。累的不只是身体,是认知——你明明该问"验收标准是什么",却在提示词里卷"请更专业、更全面、更深度"。全面常常是无边界;无边界常常是无法验收。无法验收,是单人研发里最贵的浪费。Brynjolfsson 与 McAfee 讲第二次机器革命:技术补体力,人应补判断力——判断力体现在敢删、敢停、敢写失败剧本。 失败剧本,是人岗里的硬菜——AI 可以写成功路径,不会替你写"什么情况下该删这个功能"。删,需要担责;担责,需要你对用户、对数据、对伦理的硬判断。判断在模糊区,模型会给平均答案;平均,常是"继续加、继续写、继续润色"。润色让错误更流畅;流畅让错误更晚暴露。晚暴露,修复成本更高——更高,是你和 AI 合作久了应该换来的教训,不是换来的自信。 人必须守住的五件事 合作久了,我把自己当成 product owner(产品负责人)+ QA(质量保证)+ ethicist(伦理把关)的合体,AI 是 draft engine(草稿引擎)。分工清楚,合作才久;分工糊了,合作变成互相甩锅——锅最后还在人身上。Russell 在《Human Compatible》里讲:对齐问题,最终对齐的是人类价值;价值不是更长的输出,是更少的伤害与更可持续的信任。 第一,目标与边界。 要什么、不要什么、为谁服务——AI 会帮你扩写,不会帮你担责。 第二,价值冲突。 效率与隐私、增长与诚实、短期转化与长期信任——冲突,需要人拍板。 第三,异常与伦理。 长尾场景、伤害风险、vulnerable users——模板覆盖不到,需要人判断。 第四,叙事与信任。 用户信的不是流畅段落,是"你会不会改口、会不会承认错、会不会长期在场"。在场,是人格函数,不是参数。 第五,闭环维护。 AI 可以生成,不能替你跑测试、看复测、删无效功能。维护 boring,是人岗。boring 不传播,boring 决定产品会不会第二次可用。第二次可用,靠的不是新模型,是老流程——流程在,模型换三代,产品仍站得住;流程不在,模型再新,也只是更流畅的崩。 "同时关线"才是人岗 合作久了,还有一个体感:AI 让你"同时开很多线",人必须"同时关很多线"——关,是验收、是删、是写失败剧本。 开线容易,关线难;难,正是人岗与机岗的分界。机岗负责把线开长,人岗负责判断哪条线该剪。剪需要勇气和数据;不剪,线会缠成三十万行的结——结最后还是要人解,模型不会替你背锅。背锅感 uncomfortable,但背锅感是问责的体感;没有体感,你会把流畅当成正确,直到用户流失才醒。醒,是纠错;纠错,不能外包给模型。 Kahneman 讲 overconfidence:信息越多,有时自信越高,准确未必更高。AI 让"信息很多"变得廉价——廉价信息若不经人岗筛选,会堆成"我什么都考虑了"的错觉。错觉在测评伦理里尤其危险:你可以生成看起来专业的解释,却未确认用户是否处于 vulnerable 状态、是否需要转介、是否过度标签化。标签化是伤害;伤害,模型不会自动止损,止损开关在人手。 ISO 42001 讲 AI 管理体系——体系核心不是模型多强,是问责链是否清楚:谁批准上线、谁监控漂移、谁处理伤害。单人产品也要迷你问责链:生成可以 AI,批准必须人;批准标准是验收三条,不是"读起来不错"。不错是文学标准;能用是工程标准。工程标准,决定用户会不会第二次打开。 深蓝故事还有一层 深蓝故事还有一层:卡斯帕罗夫输后研究人机协作棋局,发现人负责战略与陷阱,机器负责算度,组合常强于纯人纯机。组合的关键,不是人更努力算,是人更清楚不算什么。 不算什么,是边界;边界,是提问;提问,是验收的前置。前置做好,生成才是草稿;前置不做,生成就是赌。赌短期可能赢;赢几次,你会把赌当能力——能力应长在可重复的验收上,不是长在流畅上。流畅是阅读体验,验收是存在体验——体验断一次,用户不会读你的道歉段落,只会用脚投票。投票是数据;数据,比生成更教分工。 分工表不必漂亮,但必须非空——人做栏空着,等于把担责外包给流畅段落。 人机分工表 每周"无 AI 小时"——练模糊判断,防流畅依赖。 公测坚持人工定义测评伦理与验收标准,把生成放在草稿层——草稿可以快,批准必须慢,慢是 human-in-the-loop(人在回路)的代价,也是信任的来源。 和 AI 合作,不是变轻松,是变清楚——清楚人该守哪几件事。守不住,工具越强,偏差越大。 分工不是保守,是对用户负责;负责不能编译进模型,只能写进流程。 注: 近期系统上线公测不久,因为接口逻辑众多,还有一些bug。如果你在使用中发现问题,欢迎在小程序首页意见反馈板块或者到本公众号文章评论区使劲吐槽。这个小程序,一定程度上是"学渣"社畜们的精神家园,需要众人助力。
关于作者: 梁涛,易我测评成长系统(EvolveMe)创始人(个人微信公众号:船长汤米)。致力于在 30 万行代码的实战中,为人类构建一套傻瓜化、具象化的思考力训练闭环。他深信:思考力,是人类在 AI 时代生存的唯一根基。
点击下方创始人个人公众号名片,了解易我测评成长系统的创始心路历程。