

第十一届信也科技杯聚焦“对话轮次交互建模”,共吸引了553支队伍参赛,其中既有来自清华大学、北京大学、复旦大学等顶尖高校的学生,也有来自腾讯、阿里、华为等科技企业的从业者。
目前,该比赛已进入复赛阶段。我们邀请本届科技杯出题人、信也科技算法高级研究员倪博溢对赛题进行解读。
和语音助手对话时,我们大概都遇到过这样的尴尬时刻:中途停顿想词,它以为你说完了,抢着接话;或者你明明讲完了,它却迟疑一两秒才反应,留下一段沉默;又或者你只是“嗯”了一声表示在听,它却误以为自己被打断,慌忙停了下来。
这些问题容易被归结为AI不够聪明,听不懂话。但很多时候它接错话,不是因为理解不了内容,而是因为不知道什么时候该开口。内容答得再准确,时机错了,对话依然不自然。第十一届信也科技杯全球AI算法大赛的赛题是“对话轮次交互建模”,要解决的正是这个问题。
机器在等,人在预测
要理解机器为什么会接错话,得先看它是怎么工作的。今天市面上绝大多数语音机器人的内部都遵循同一套流程:先把声音转成文字,再交给模型理解、生成回复,再把回复转成声音播出去。这套设计有一个前提,机器必须等人把话说完,才能开始处理。
那机器怎么判断一句话是不是说完了?最常见的方法是看停顿时间,停顿超过某个设定时长,比如700毫秒,它就默认这一轮结束,轮到自己开口。问题在于,这个时长没有最佳答案。设定短了,句子中正常的停顿和犹豫会被误判为结束,机器容易抢话;设定长了,人已经讲完,它却还在等待,于是冷场。有研究表明,人一句话中间的停顿,平均比真正说完整句话后的停顿还要长。这意味着,无论把时长设成多少,都很难同时避免抢话和冷场。
在倪博溢看来,传统AI在对话上的短板,在于建模把语音对话简化成了文本对话。文本对话天然是你一句、我一句,不存在抢话和中途打断的情况,但真实交流远没有这么规整,穿插、打断、附和几乎无处不在。
人与人之所以能把对话接得自然,靠的是边听边预测。研究发现,两个人完成一次自然的对话轮换,中间的间隔通常只有约200毫秒,甚至可能是负的——一方还没说完,另一方已经接上了。这不是抢话,而是听话的人已经预判出,对方快要说完了。
这种预测,依赖的不只是内容本身,还包括语气、语调、语速、响度等声音里的信号。倪博溢举了个例子:一个人说话时声音越来越低、语速逐渐放慢,往往意味着一句话接近尾声;而刻意拖长尾音,则是在告诉对方:“我还没说完。”
因此,本届信也科技杯希望模型学会的,并不是判断一句话已经结束,而是提前一步预测对方接下来会继续说、准备让出话轮,还是只是想附和一声。
让模型学会social
想让模型尽可能接近真人的互动状态,最核心的困难在于,对话既有规律可循,又充满随机性。规律来自内容本身。说了什么、一句话有没有接近结束,都可以从语义中推理。但人与人的互动,又很难完全预测。两个人心里在想什么,会不会突然打断、什么时候选择附和,往往就在一念之间。
“有可能我突然就想插嘴了,但也有可能我一下子又忍住了,我就没说。”倪博溢说。正因如此,打断、附和这类行为,很多时候并没有固定规律可循。这也意味着,这道题很难像传统分类任务那样拥有唯一正确答案。
倪博溢举了一个实际业务中的例子:评价一个机器人客服,很少有人会精确计算它是否早了200毫秒,或者晚了300毫秒才接话。更多时候,大家关注的是整体体验——它接话顺不顺、插话是否得体、该回应的时候有没有及时回应。聊完之后觉得自然、舒服,它就是一个好的机器人。
因此,这道题想让模型学会的,其实不只是预测。“我们更希望它成为一个会沟通、懂得社交、能‘social’的人。”倪博溢说。这意味着,模型不仅要预测什么时候该说话,还要理解自己在对话中的角色。例如客服需要耐心,让用户把话讲完;换一种身份,在合适的时候也需要适度打断,把该传达的信息及时传达出去。这里没有唯一正确的答案,只有在具体场景下更合适的选择。
没有标准答案的赛题
把一个没有标准答案的问题设计成一道算法赛题,本身就是一件不容易的事。赛题的几处设计,体现了出题人对真实对话的理解。
首先是时间窗口。赛题提供了三十秒的对话音频作为上下文,要求选手预测未来两秒内会发生什么语音事件。倪博溢解释,关键不在于30秒这个数字,而是模型需要先“听”一段过去。“三十秒基本足够判断两个人的交互模式。”他说。谁更容易抢话,谁习惯附和,两个人聊天的节奏是否默契,这些都会逐渐显现。当交互模式建立起来后,再预测接下来两秒发生什么,就有了依据。
其次是事件分类。赛题要求选手判断五类语音事件:继续(continuation)、轮换(turn change)、短回应(back channel)、打断(interruption)和沉默(silence)。其中,轮换是整个任务的核心,因为它决定了机器什么时候应该接话。而短回应虽然在数据中的占比不到1%,赛题依然保留了这一类别。所谓短回应,就是一方说话时,另一方用“嗯”“对”等简单回应表示自己在听,却不会打断对方。倪博溢认为,这是目前行业普遍没有做好的能力。但如果机器能够在恰当的时候回应一句“嗯”,用户往往更愿意继续说下去,机器也能获得更多有效信息。

上图展示了说话人(红线)和倾听者(绿线)对话中发生的语音事件
最后是数据集。本届比赛采用覆盖30多种方言的真实语音对话,这些对话大多来自日常交流场景,其中还包括客家话等难以准确转写成文字的方言。当文字难以提供可靠信息时,模型就必须更多依赖声音本身去判断轮次。语调、语速、响度等信息,不再只是语音的附属特征,而成为决定什么时候接话的重要依据。赛题希望选手关注的不只是语言内容,也包括声音本身所承载的交互信号。
一道题的价值
信也对这道题的选择,来源于真实业务场景的沉淀。语音客服是公司深耕多年的方向,旗下智能机器人Blu支持中文、英文、西班牙语、印尼语和菲律宾语,已覆盖9个国家,每日服务量超500万次。如今,Blu已经具备多语种能力与拟人的音色,但如何让机器像真人一样把握对话节奏,仍然是智能交互中最难解决的问题之一。如果这道赛题能够取得突破,相关成果就有机会应用到真实业务中,让机器不仅听起来像人,也能更好地与人沟通。
它的价值也不止于一家公司的业务。对话轮次预测一直是学术界持续研究的重要课题,也是整个对话建模中尚未完全解决的问题。相比不断做大语言模型,把对话节奏单独作为一个能力来建模,不仅有助于推动相关研究,也让技术在工程落地时拥有更高的灵活性。
截至目前,第十一届届信也科技杯共吸引776名选手、553支队伍参赛,既有来自清华大学、北京大学、复旦大学等国内外高校的学生,也有来自腾讯、阿里、华为等科技企业的从业者。与往届相比,今年出现了不少单人组队的选手。大模型降低了个人参赛的门槛,也让“单兵作战”成为可能,但真正拉开差距的,依然是对问题本身的理解。
大多数参赛方案都采用了多模态思路,但倪博溢也期待看到更多不同的尝试。“我们并不希望大家只是用大模型去‘暴力破解’这道题,更希望选手们回到问题本身,从对话交互的原理出发去建模。”
目前,比赛已进入复赛阶段,将于7月20日公布晋级名单,晋级队伍将在7月底进行决赛现场答辩。优秀团队将有机会直通顶尖会议NLPCC2026,与全球AI学者面对面交流。

▼点击阅读原文直达大赛官网
夜雨聆风