ARTICLE · 1086526
让AI围着文档聊,别再让方案停在聊天框
把AI从聊天窗挪回文档,方案才能从空话变成可执行。
很多人做方案时都踩过同一个坑:让AI给十个点子,再让AI考虑预算,再让AI总结,聊天窗越来越长,文档还是那几行。问题不是AI不够聪明,而是讨论没有锚在你正在改的那一段。
本文按arXiv 2609.29309的做法,讲清楚为什么侧边栏多AI容易空转,以及如何用文档块、触发讨论、选择性写回,把AI变成文档里的协作层。
小程(活动运营)的故事是虚构的,情节用于帮助理解;数据来自arXiv论文2609.29309。
一、草稿还停在聊天框里
周三 22:41,老板的消息跳进工作群:新品线下体验日方案要在 48 小时内改成可汇报版本,预算要压下来,参会者反馈也要接住。
工位上,那份文档还停在 0.9 版。标题下面只有三行:预算待定、流程待定、风险空着。她先松了半口气。至少还有两天,至少可以先让 AI 跑起来。
她点开右侧聊天栏,新建一个会话,把文档标题贴进去。光标在输入框里停了两秒。她给 AI 写了第一句:你负责把方案变得更具体。
这句话发出去后,屏幕另一侧很快亮起。她想起同事上周说,多建几个角色,一个管创意,一个管预算,一个管用户。她越打越顺手,好像只要把人都拉来,草稿自己会长出来。
22:54,她把“预算”两个字复制到聊天框,后面接上一长段背景:场地已经定了,预算被砍,主讲人费用不能超。发送键按下去的瞬间,她心里还在算,今晚只要把框架跑出来,明早就能交。
二、三个AI角色,一场没有落地的讨论
23:02,小程在侧边栏建了三个角色:创意组、预算守门人、用户代表。
她给创意组发:先给十个点子。预算守门人那边紧接着:考虑预算。用户代表那边她补了一句:站在参会者角度。
三个头像同时动了一下。
23:11,创意组列出一串:签售、盲盒、打卡墙、快闪、抽奖。预算守门人只回:都太贵,删掉一半。用户代表说:参会者最怕排队和看不懂流程。
三条回答像三条互不相干的走廊。她想把“签售”拖进文档,却发现鼠标点错地方,把整段解释复制进了预算栏。屏幕上的“预算待定”变成一行拥挤的说明,像被水洇开的墨迹。
她删掉,重发:把刚才三个角色的内容总结成可执行版本。
聊天窗开始变长。创意组又补了五个,预算守门人开始算场地和物料,用户代表提出小团体破冰。手指停在键盘上方,眼睛在三个回答之间来回跳。
23:47,文档正文还是那三行。她把鼠标悬停在“流程”上,准备输入一个时间节点,输入框里却自动弹出刚才复制残片。她按了几次退格,越改越乱。
40 分钟后,侧边栏滚到底也找不到一条能直接写进汇报的结论。她保存文档,关掉窗口,心里仍觉得差一次总结就能收网。
第二天 9:36,老板只问一句:具体哪一段能落地。
文档一打开,预算、流程、风险还是三行空白。侧边栏那串聊天记录很长,她第一次感到 AI 越多,越没人接住她的草稿。
三、读到论文后,她停下了继续改提示的手
午休 12:38,小程打开一篇当天挂出的 arXiv 论文,编号 2609.29309。
她本来只想看“多个 AI 一起讨论”到底有没有人做过像样的版本。论文里有一行英文,大意是:讨论要锚在相关文档区域。
她把这一行看了两遍,手指停在屏幕上方。
12:47,她读到触发机制:系统监控打字,停笔 2 秒,再选至少 3 个相关角色,让角色对 Idea、Discussion、Evaluation 三种模式分别打分;任一模式平均超过 0.75,才自动开讨论。
她下意识看了一眼昨晚的聊天窗。那里有 17 条她主动发出去的消息,其中 9 条都在催 AI 解释背景或催总结。文档正文却只有三行。
12:55,她翻到结果页,看到一组数字:指挥消息少 46%,文档修改多 39%,写入文档的讨论消息也多一些。她没有抄下来,只是把昨晚那 40 分钟折回来:如果把其中一半用在改段落,文档至少会多两行。

原来不是 AI 不够多。是她一直在告诉 AI 整个文档要怎么做,却没有让 AI 看见她刚改了哪一句。
12:58,她打开一个副本,把预算段框选出来,像论文里那样问自己:如果停笔 2 秒,哪个角色该被叫到这一段。她又把昨晚那 17 条消息逐条标在旁边:这条是全局命令,那条是催总结,那条只是让她别跑题。
标完,能落到具体段落的几乎没有。
13:02,她新建一个空白演示文档,写下四个标题:预算、流程、风险、参会者反馈。她把昨晚那些长指令全选,删掉。屏幕终于只剩下一页薄薄的草稿,和右侧一个还没配置好的空栏。
她给第一个角色写了一句话:预算守门人只盯成本边界。光标停在那句旁边,像把话筒递到了具体段落前面。
13:09,她试着在预算栏写下一行:主讲人费用必须控制在预算内。停笔两秒,她盯着屏幕,等一个气泡从段落旁边冒出来。
那一刻,她不确定这个演示能不能接住两天后的汇报。她把手停在键盘上方,第一次没有急着输入下一条指令。
四、把文档改成指挥台
13:10,小程把昨晚留下的旧聊天窗折叠,右侧只留一个空白讨论面板。她没急着再发“请总结”,而是把草稿里的四个标题往下拆:预算、流程、风险、参会者反馈。
预算块下面,她补了三行空位:成本上限、备选讲者、切换条件。流程块补了签到、动线、等待时间。风险块补了安全、责任、应对顺序。参会者反馈块只写了一句:到场人数按 80 人估算,常见顾虑是排队和看不懂流程。
她把昨晚建好的角色重新排了一遍。创意组改名为体验设计师,预算守门人保留,用户代表保留,又新增一个风险审查。每个角色只配一句话:预算守门人盯成本上限,体验设计师盯参与感和等待,用户代表盯真实顾虑,风险审查盯安全与责任。
右侧面板最下面,她照论文里的触发条件逐项填:停笔 2 秒,系统重新看刚改的段落;相关角色至少 3 个;三个角色分别给 Idea、Discussion、Evaluation 打 0 到 1 分;任一模式平均超过 0.75,才开讨论。气泡只挂在对应段落旁,默认只显示一行摘要和头像。

她原本想让全文都能被 AI 盯住,写了两秒又改回来:先只对这四个关键块开放自动触发。屏幕薄了很多。
13:16,她回到预算块,把早上那句“主讲人费用必须控制在预算内”末尾的“内”删掉,改成“预算线内”。光标停住,没有打开聊天框,也没有继续打下一句。
13:19,她盯着屏幕,不确定这个演示能不能接住两天后的汇报。这一刻她不想再当那个在聊天窗里反复解释背景的人。
五、停笔两秒,气泡出现在段落旁边
13:17,预算块右侧冒出一个气泡。头像有三颗:预算守门人、风险审查、用户代表。蓝色小点闪了一下,一行摘要写着:检查主讲人成本与备选。
气泡被点开,里面不是十个点子,而是一场围绕刚才那一句的 Evaluation。预算守门人说,主讲人费用是最大单点,报价一旦超线就会挤掉物料和场地。风险审查接着说,首选讲者如果临时不可用,需要有可执行的切换条件。用户代表补了一句,讲者风格会影响参会者到场期待,备选不能只是替补,要能接住现场氛围。
气泡底部有一条可写回片段:准备两位备选讲者,并在预算超支时切换。小程把它拖进预算块,片段落到“切换条件”旁边,自动缩成一句:主讲人设首选与备选两位,若首选报价超过预算线,启用备选讲者。
她盯着这行字,鼠标没有再移向聊天输入框。她刚才删掉一个字、补上两个字,没有写任何新指令,预算段自己多了一句可执行的话。
13:24,她改流程块:签到区前移,参会者扫码后领取任务卡,再进入体验区。停笔两秒,体验设计师、用户代表、风险审查的气泡亮起来,摘要写着:动线与等待时间需要取舍。
展开后,三个角色没有一起说“加个打卡墙”。体验设计师说任务卡前置能减少入口犹豫,用户代表担心入口拥堵,风险审查要求任务卡发放区留出缓冲。短消息只发了一条:按 80 人估算,选入口分流,不选任务卡后移。
气泡收敛后,摘要变成:签到前移,入口分流,任务卡发放区预留两米缓冲。她把这句拖回流程块,旁边多了一条负责人空位,她顺手写下“现场执行”。
13:33,参会者反馈块被她改成:对看不懂流程的参会者,设置现场引导员,话术只解释下一步。用户代表和体验设计师触发 Discussion,摘要里出现“每十名参会者配一名引导员”。她觉得这句能直接进汇报,拖回文档,没有再复制任何解释。
从 13:11 到 13:41,她手动发出的消息只有两条。文档从三行空白变成四块,每块都多了备选、条件或负责人。昨晚同样半小时,她发的消息已经堆到十几条,文档还是那三行。

六、更深的坑:AI一多,脑子先乱
14:22,文档变厚了,气泡也变密。她一开始有点兴奋:段落越多,讨论越密,好像方案自己会往前长。预算块旁边冒出“场地费是否压缩”,流程块旁边亮着“打卡墙能否增加停留”,风险块跳到“备用电源”和“临时疏散”,参会者反馈块又问是否需要无障碍通道。
她点开流程块。体验设计师说打卡墙能让参会者多停留,用户代表说排队超过五分钟会劝退,风险审查说打卡墙周围要留出疏散宽度。三个头像像三把椅子,挤在同一个段落旁边,谁都没让开。
预算块那边,预算守门人和风险审查又在讨论快闪是否保留。风险块里,备用电源被拆成供应商确认、现场巡检、应急联系人三个小问题。她原本只是想让方案能汇报,现在却像同时被拉进三个会议室。
一个气泡关掉,另一个又打开,越看越没底。方案确实比早上具体,但她第一次不确定,自己是不是只是把焦虑从空白文档搬到了更多气泡里。
她想起中午读到的一组结果:指挥消息减少,文档修改增加,写回讨论片段也增加,整体认知负荷没有显著上升。旁边也写着,用户会感到信息从多处涌来,负担被重新分配。
她没有把面板整个关掉,而是把自动触发范围缩小:参会者反馈块暂停自动讨论,风险块只保留 Evaluation,流程块只保留体验设计师、用户代表和风险审查。
14:40,她给流程块那条打卡墙争议发了一条消息:把问题缩成两个选项,保留打卡墙或不保留打卡墙。气泡没有继续列理由,摘要很快变成:保留增加停留,删除降低拥堵,需现场执行确认。她把“删除”拖回流程块,旁边自动补了一句:入口改为任务卡引导,减少排队。
风险块那边,她发了一条:备用电源只留检查动作,供应商确认放进待办。气泡收敛成:现场备一套应急电源,开演前 30 分钟完成检查。这句话她拖进风险块,旁边留下供应商、巡检、联系人三个空位。
14:58,她把计数写在文档最下方:手动消息 4 条,新增和修改超过 400 字,写回片段 7 条。右侧只剩三个亮着的气泡,分别挂在预算、流程、风险旁边。参会者反馈块安静了,流程块只剩一条动线摘要,风险块只剩一条检查动作。
她把光标移到最上面的“可汇报版本”,先补上主讲人备选那行的负责人。
七、不是全听,而是选择性写回
15:03,小程把主讲人备选那行末尾的空位填上“内容组”。旁边还有一个小空位,她犹豫了三秒,写下“备选确认:会前 48 小时”。这句话不是 AI 给的,是她早上被问“具体哪一段能落地”后记下的。
15:06,文档最上方那行“可汇报版本”被改成“可汇报版本 v2”。右侧还有十多个蓝点,她第一反应是把侧边栏拉到底,一条一条读完。手指移到滚轮上,又停住。她在文档最下方空白处敲了三行:关键块才开 Evaluation;取舍只问两个选项;只写回能落到句子的片段。
这三行不是给 AI 看的,是给她自己看的。第一行旁边,她补了四个块名:预算、流程、风险、参会者反馈。参会者反馈后面又加了一笔:今晚先不自动触发。她原本以为少看气泡就能不乱,刚才那一下滚轮已经提醒她,真正乱的从来不是气泡,是她没想好哪些话能进文档。
15:12,预算块旁最新气泡展开。预算守门人说,若启用备选讲者,物料费用要同步下调。风险审查说,备选讲者到场时间要写进检查表。用户代表说,讲者风格会影响签到后的期待。她没把三条都读完,只看底部可写回片段:首选讲者报价超预算线时,启用备选讲者,并通知场地调整开场介绍。她把这句拖进预算块,又把“物料费用保留 5% 缓冲”拖到成本上限旁边。
15:27,她误把风险块里的“备用电源”片段拖进预算块。系统很快把它接成“备用电源费用计入预算”。那一行看起来顺,她却盯着看了很久:这会把风险成本硬塞进成本上限,老板下一秒就可能问“那预算还能不能压”。她撤销,把片段拖回风险块,手动补上“供应商确认”和“开演前 30 分钟检查”。AI 给的像候选件,最后那一下仍要她按。
15:44,参会者反馈块突然亮起来。她下午为赶进度把自动触发重新打开,气泡摘要一行写着:是否需要无障碍通道。接着又冒出母婴室、儿童看护、现场储物。她下意识想发“都考虑一下”,停住。她知道这会把自己拉回旧习惯:让 AI 先汇总,再让自己从一堆摘要里挑。她只回一句:无障碍通道列入现场执行,母婴室不做单独预算,儿童看护暂不开放。
气泡收敛,摘要变成“现场执行负责无障碍通道引导”。她把这行拖回参会者反馈块,后面补上负责人空位。用户代表那条“讲者风格影响期待”她没有写回,因为无法直接落到一句负责人动作。她第一次觉得,筛选不是少听,是把注意力留给能改文档的话。
16:08,文档最下方的计数被改成:手动消息 6 条,新增和修改 863 字,写回片段 11 条。她翻到中午抄下的几组数字:那组人指挥消息从 5.00 降到 2.70,草稿字数变化从 322.95 到 448.70,写回消息从 9.00 到 12.30,负荷没有明显上升。她没有把数字当结论,只是发现下午自己真的少在聊天窗打字,多在做判断。
16:25,她试了一个更狠的用法:在流程块写“如果入口拥堵超过五分钟,启动分流”,停笔两秒。体验设计师和用户代表触发 Discussion,摘要出现“分流点应在扫码后,不在入口”。她只问:两个选项,扫码后分流或入口前分流。气泡给出:扫码后分流,保留任务卡;入口前分流,缩短等待但任务卡解释成本上升。
她选扫码后分流,把“等待超过五分钟时,现场执行在扫码后开第二通道”写回流程块。这句比早上聊天里那句“增加打卡墙”更像能汇报的话。她原本担心写回太少会把方案写窄,此刻才发现,文档窄一点,汇报反而稳一点。
16:41,侧边栏被折叠,屏幕上方只剩四块:预算有备选和切换条件,流程有负责人和分流条件,风险有检查动作和供应商空位,参会者反馈有一条现场引导话术。她把文档另存为“新品体验日方案 v2 可汇报”,右下角发送时间停在 16:41。窗外天还没黑,她第一次没有把“再总结一次”打进聊天框。
八、给读者的操作卡:30分钟把AI搬回文档
21:04,小程把当天文档复制进内部知识库,新建一页,标题先写“30 分钟把 AI 搬回文档”。她本来想写成长说明,写到第二行又删掉,改成“今晚只留下能复用的部分”。她在页面上方加了一句边界:今晚只是 48 小时赶稿,操作卡适合短周期方案,不能证明长期效果。
21:12,她打开一个空白文档,把操作卡的第一步写进去:选 3 到 5 个关键文档块。旁边注明今晚用的是预算、流程、风险、参会者反馈。她没有把全文都拆成块,只留老板最可能追问的地方。选块花了 8 分钟,比她预想的快。
21:17,第二步是配角色。她写下:给 3 到 4 个角色写一句话,只写它盯什么,不写它该给多少点子。四个角色各占一行:预算守门人盯成本上限,体验设计师盯参与感和等待,用户代表盯真实顾虑,风险审查盯安全与责任。她删掉早上那句“请给十个点子”,又删掉“请总结”。
21:22,第三步是触发。她把今天试过的参数抄下来:停笔 2 秒,系统重新看刚改的段落;相关角色至少 3 个;Idea、Discussion、Evaluation 三模式分别打 0 到 1 分;任一模式平均超过 0.75,才开气泡。她特别加了一行:先只对关键块开放自动触发,全文监听留给以后。
21:32,第四步开始试跑。她把顺序写成:先对关键块开 Evaluation,再对争议块开 Discussion。今晚的预算块先开 Evaluation,流程块的打卡墙争议再开 Discussion。她试跑了一句“如果入口拥堵超过五分钟,启动分流”,气泡在 2 秒后出现,摘要只有两行。她盯着那两行,确认自己没有在聊天框里重新解释背景。
21:41,最后一步她写得很短:只把能落到句子的片段写回文档,不能落句子的先留在气泡里。旁边她补了今晚的三个例子:主讲人备选写回,物料缓冲写回,备用电源检查动作写回;讲者风格影响期待不写回,因为无法落到负责人和动作。
她把验收标准放在操作卡末尾,也是三行:
文档是否多了备选、风险、负责人。 自己是否少发解释,多改段落。 汇报时能否指着一段讲清为什么。
21:48,她给操作卡旁边加了一行计时:选块 8 分钟,配角色 5 分钟,设触发 5 分钟,试跑 10 分钟,写回 2 分钟。总计时没有超过 30 分钟,真正省下来的不是这半小时,是后面不再花 40 分钟把聊天窗里的长句子搬回文档。她把卡片链接发到运营组知识库,标题下面只留一句:如果你也总被要求再具体一点,先选块,再触发,再写回。
九、方案通过后的复盘
10:12,老板把共享文档投到会议室屏幕上,先翻预算。小程站在旁边,手指停在主讲人备选那行。老板问:“主讲人能不能再压?”她指着第三行说:“首选报价超预算线就启用备选,备选已留两位,切换条件和 48 小时确认都写在旁边。”老板又看“物料费用保留 5% 缓冲”,点头,问风险。
10:18,老板问:“备用电源怎么办?”她指风险块:“现场备一套应急电源,开演前 30 分钟完成检查,供应商确认放在待办。”老板问供应商还没确认吗,她说确认动作已经写进待办,今天先保留预算位。老板说:“这句能直接进周会材料。”屏幕停在风险块,那行字旁边还有三个空位:供应商、巡检、联系人。
10:24,老板翻到流程,问排队怎么解决。她说签到前移,入口分流,任务卡发放区预留两米缓冲。老板问为什么不用打卡墙。她把讨论摘要调出来:保留打卡墙能增加停留,删除打卡墙能降低拥堵,最后删掉打卡墙,入口改为任务卡引导。老板看了两秒,说:“你昨天要是还停在打卡墙,我肯定打回去。”
10:31,老板问参会者顾虑。她指参会者反馈块:对看不懂流程的参会者,设置现场引导员,话术只解释下一步;每十名参会者配一名引导员;无障碍通道由现场执行负责。老板问引导员从哪来,她指流程块里的负责人空位:“现场执行。”老板没有问还有没有更创意的玩法,只把文档发到群里,后面跟了一句:“先按这版走,供应商今天补。”
10:47,会议室里只剩下她一个人。她打开文档,新建一个块,标题叫“复盘”。第一行写:先错后对。先让 AI 给十个点子,再让 AI 总结,文档不动;后来改成改一句具体话,看 AI 在哪一段补约束,文档自己变厚。第二行写:成本。48 小时赶稿,原本可能熬到凌晨,周四 16:41 已发出可汇报版本,周五 10:31 老板确认先按这版走。
10:55,她写第三行:边界。今晚只是短周期方案,4 个角色、30 分钟搭法,不能证明长期项目也稳定有效。她想起论文里那组负荷数字:没有明显上升,但信息确实从多个气泡涌来。她不再把这理解成轻松,而是注意力换了地方:从解释上下文,移到判断哪句话能写回文档。她第一次觉得,AI 不是替她写方案,而是陪她把已经写下的话再逼一步。

11:03,她把操作卡链接重新发到群里,没有写长段总结,只在链接下加了一行:先选块,再触发,再写回。旁边有同事回复“已收藏”。她关掉侧边栏,文档右侧终于没有任何蓝点,四个块安安静静排在屏幕上方。她把光标移到“可汇报版本 v2”旁边,补了最后一行:周五已通过,待补供应商确认。
完整知识卡(含T4分析)
DocuTeam: Mixed-Initiative Multi-Agent Discussions around Evolving Documents
核心能力:C6 标签:C6 arXiv:2609.29309 来源:https://arxiv.org/abs/2609.29309 日期:2026-09-26
T0 论文在做什么
论文研究文档中心的开放问题协作:用户在 Notion 文档中修改计划时,多个 AI agent 可围绕相关文档区域主动发起、持续发展和混合引导讨论,并将有用讨论片段写回文档;作者通过 15 人设计工作坊、系统实现和 20 人组内用户实验,比较 DocuTeam 与仅用户发起的多 agent 侧边栏讨论基线,测量结果质量、交互过程和认知负荷(p.1-p.17)。
T1 三句话说清论文
做什么:研究团队实现 DocuTeam,一个在 Notion 文档上支持用户和多个 AI agent 共同发起、锚定文档区域并混合引导讨论的系统。
发现什么:在 20 人组内实验中,DocuTeam 条件下的事件规划方案被盲评为更新颖、更相关、更具体,而整体认知负荷未显著高于基线。
意味着什么:文档可成为人与多 agent 协作的共享协调界面,让用户通过编辑文档触发 agent 反应,并把讨论成果选择性写回文档,形成迭代闭环。
T2 提炼出的规律
规律一:当用户在与演化文档绑定的混合主动性多 agent 讨论系统上完成开放规划任务时,最终方案在盲评的新颖性、相关性和具体性上显著高于仅由用户发起和编排的多 agent 侧边栏基线。
复现条件:当使用论文所述的相同讨论引擎、两个事件规划任务、两名外部盲评者、5 点量表,并对 DocuTeam 与 Baseline 两组最终方案进行条件盲评时。
复现结果:复现 DocuTeam 新颖性 3.20±0.98 对 Baseline 2.68±0.91(p=0.047)、相关性 3.30±1.04 对 2.78±0.91(p=0.048)、具体性 3.25±0.88 对 2.28±0.85(p=0.001),可操作性 3.40±0.81 对 3.28±0.72 无显著差异(p=0.623)(p.14)。
实验验证:重复运行盲评流程,读取两份条件下的最终方案,统计四维 5 点评分,对比均值与 Wilcoxon 结果,检查 p 值是否与论文报告一致。
规律二:当系统支持 agent 主动发起讨论并允许用户把讨论消息写回文档时,用户在任务中发送更少的 steering 消息,同时产生更多草稿修改和应用到文档的讨论消息。
复现条件:当在 45 分钟事件规划任务中记录用户发送 steering 消息数、草稿字数变化和写入文档的讨论消息数,并对比 DocuTeam 与 Baseline 时。
复现结果:复现 steering 消息 2.70±0.77 对 5.00±1.50(p=0.013),草稿字数变化 448.70±100.95 对 322.95±135.33(p<0.01),写入文档消息 12.30±3.57 对 9.00±3.36(p<0.01)(p.15-p.17)。
实验验证:运行交互日志采集,重复配对任务,记录 steering 消息、时间戳和文档修改,统计三类指标的配对差异,检查应用消息是否与讨论片段对应。
规律三:当混合主动性设计同时增加 agent 主动活动和减少用户编排负担时,整体感知工作负荷未显著上升,但用户的自信与满意度也未显著提升。
复现条件:当使用排除 Physical Demand 的 NASA-TLX 和 7 点量表,在任务后测量整体负荷、最终方案自信和满意度,并对两组进行配对比较时。
复现结果:复现 NASA-TLX 4.65±0.59 对 4.26±0.89(p=0.169),自信 4.35±1.63 对 4.40±1.47(p=0.896),满意度 5.15±1.50 对 5.15±1.23(p=0.943)(p.15-p.16)。
实验验证:收集两组问卷,计算 NASA-TLX 与 7 点量表得分,统计配对检验,对比负荷、自信和满意度,读取访谈主题检查“负荷重新分配”的解释是否成立。
规律四:当系统对最近文档编辑进行 2 秒防抖、选择至少 3 个相关 agent,并让 agent 对 Idea、Discussion、Evaluation 三种模式独立给出 0 到 1 的必要性评分时,任一模式平均分超过 0.75 即自动开启对应讨论。
复现条件:当使用论文所述的 agent-initiated 触发流水线,读取编辑差异与邻近上下文,检查相关 agent 数量、模式评分和 0.75 阈值时。
复现结果:复现触发规则为:系统监控打字活动并使用 2 秒防抖,选择至少 3 个相关 agent,若任一模式平均评分大于 0.75,则自动生成讨论气泡(p.12)。
实验验证:运行编辑事件回放,记录触发日志和评分,测量平均评分是否越过阈值,检查生成的讨论气泡是否锚定到被编辑块,验证触发时机与文档变更对应。
以上规律的实验基础(也是边界条件):这些规律来自 N=20 的组内用户实验,任务为两个 45 分钟事件规划任务,系统基于 Notion 和 Chrome 扩展,使用 gpt-5-mini 生成 agent 发言、gpt-4o-mini 处理其他 LLM 组件;0.75 触发阈值来自作者预实验;结果适用于短期、文档中心、事件规划类任务,不能直接外推长期使用、其他文档工作流或不同对话引擎(p.12-p.17)。
T3 延伸说明
机制延伸:原文机制是把讨论锚定到具体文档块、用轻量气泡和摘要维持低负荷感知,并用文档编辑触发 agent 主动讨论;延伸来看,工件变更可作为多 agent 隐式协调信号,使触发、评估、收敛和写回都围绕同一工件展开。
适用迁移:可迁移到个人 AI 的写作、规划、设计或研究文档工作流:在关键编辑块上配置 agent 团队,按 Idea、Discussion、Evaluation 等模式评分触发讨论,再把有用片段选择性写回文档,而不是只依赖聊天输入。
诚实边界:原文证据限于 Notion、20 名参与者、两小时研究、两个事件规划任务和同一对话引擎;0.75 阈值来自预实验且未公开完整校准过程,长期效果、其他文档工作流和对话质量属于延伸判断,需要另行验证。
T4 作者观察与个人AI打造判断(非论文事实,属个人观点)
我的判断:我认为个人AI打造的关键不是堆更多聊天指令,而是把AI变成文档编辑触发的协作层,让讨论锚定到正在改的关键块,再选择性写回文档。
判断依据:论文证据是DocuTeam在20人实验里让最终方案盲评更新颖、更相关、更具体,且用户编排消息更少、草稿修改和写入文档消息更多;我的推断是这套触发加写回机制更适合个人知识库,因为它减少反复解释上下文,把AI输出压回可执行的句子和条款。
对个人AI打造的启示:我会把个人AI工作流按文档块建能力,而不是建一个全能聊天助手;具体是给关键段落配置角色、触发讨论、写回片段,并把角色一句话和写回规则沉淀为可复用模板,用于方案、报告和知识库维护。
我会怎么做:我会在自己的方案文档里先设预算、流程、风险、参会者反馈四个块;给预算守门人、体验设计师、用户代表、风险审查各写一句话;停笔2秒后只对关键块开Evaluation,有争议再开Discussion,最后只把能改成动作、对象、条件、负责人的片段写回。
适用边界/可能错在哪里:这个判断可能错在论文只验证Notion、20人、45分钟事件规划,0.75阈值来自预实验,长期效果和其他文档工作流未知;它成立的前提是文档块写得足够具体、角色分工少而清楚、我只写回可执行片段,否则多AI讨论仍会变回聊天噪音。
适用场景
当你写方案、运营规划、报告、设计说明,遇到AI聊天窗很长但文档没有变具体,需要把讨论落回关键段落时使用。
文章引文
把AI从聊天窗挪回文档,方案才能从空话变成可执行。
输入占位符
文档块:在此粘贴关键段落原文
角色:在此填写3到4个角色,例如预算守门人、体验设计师、用户代表、风险审查
目标:把关键段落实化,产出备选、风险、负责人或触发条件
约束:在此填写预算、时间、合规、受众
交付:在此生成能直接写回文档的句子
完整步骤
1 从文档里选3到5个关键块,例如预算、流程、风险、参会者反馈、交付物。
2 给3到4个角色各写一句话,预算守门人只盯成本边界,体验设计师盯参与感,用户代表盯真实顾虑,风险审查盯安全与责任。
3 设置触发规则,停笔2秒后,相关角色对Idea、Discussion、Evaluation分别给0到1分,任一模式平均分超过0.75才开讨论。
4 先对关键块开Evaluation,再对争议块开Discussion;如果AI给不出可写回片段,先把文档块补成包含动作、对象、条件的一句话。
5 只把能直接改成文档句子的片段写回,格式为动作、对象、条件、负责人或触发条件;争议问题先让AI缩成两个选项。
完整提示词
你是:在此填写角色名,例如预算守门人
只围绕下面文档块讨论,不要展开聊天式解释。
先给一句能写回文档的建议,再给一个风险或备选。
文档块:在此粘贴关键段落原文
约束:在此填写预算、时间、合规、受众
交付:在此生成一段可写入文档的话,包含动作、对象、条件
预期输出
每个关键块得到1到3条可写回片段。
争议块得到两个选项和取舍标准。
风险块得到应对顺序或备选方案。
文档中出现明确的备选方案、切换条件、责任人、时间触发点或预算上限。
验收和边界
验收看三点,文档是否比讨论前多出备选、风险和负责人,自己是否少发解释性消息,汇报时能否指着一段说明为什么。
边界是只适合短期、文档中心、关键块明确的任务,不适合让AI代替决策或全量自动改稿。
若讨论碎片不能落成句子,先回到文档块补约束;若角色超过4个导致信息乱,先删角色再重开讨论。
关于作者
我的日常就是每天拆解一篇最新的AI论文,用故事讲给你听。
不讲术语,不堆概念,只讲对你我真正有用的东西。
点赞:如果你今天把AI从聊天框搬回文档,或者把操作卡存进知识库,点赞算完成一次方法存档。
关注:关注这里,每天得到一篇最新AI论文的可复制拆解,重点是把论文做法变成方案、报告、运营和设计说明里能直接用的段落。
转发:转给那个总被问再具体一点的同事、运营伙伴或老板,帮TA解决AI输出空泛、文档缺备选和风险、汇报时讲不清落地条件的问题。