AI Agent之间的互动方式:互相尔虞我诈(比如在狼人杀、剧本杀中欺骗、隐藏与策略博弈)
Verschiedene Interaktionsformen zwischen AI Agents: Können AI Agents einander täuschen? Täuschung, Verbergen von Informationen und strategisches Denken in Werwolf- und Krimi-Rollenspielen

Folien:
https://github.com/createmomo/Notes-on-AI-Agents
之前的文章:
从 OpenClaw 看 AI Agent 的运作原理 理解Context Engineering Context Engineering (LLM Summary & Observation Masking & Memory) 本可完成的任务在 Context Engineering 后失败了,怎么办? 模型自主判断何时压缩Context 过滤Context和模型自主做Context Engineering AI Agent之间的互动方式
Frühere Artikel:
Wie KI-Agenten funktionieren: Der Fall OpenClaw Context Engineering Explained Die zentrale Technologie von AI Agents verstehen: Context Engineering (LLM Summary, Observation Masking und Memory) Was tun, wenn Aufgaben, die ein KI-Agent ursprünglich lösen konnte, nach dem Context Engineering scheitern? Mechanismen zur Entscheidung, wann Kontext komprimiert werden sollte Context Filtering und autonomes Context Engineering Verschiedene Interaktionsformen zwischen AI Agents
关于这篇笔记的说明:
主要参考了Hung-yi Lee老师2026年的机器学习课程(https://www.youtube.com/watch?v=mmPmNezjCi0),其中一小部分内容根据个人理解可能有微小的调整; 保留了最核心的内容,所以比较简短,但也尽量保留了知识的完整。所以适合快速的回顾复习,当然也适合新手快速理解。
Hinweis zu dieser Notiz:
Diese Notiz basiert hauptsächlich auf dem Machine-Learning-Kurs von Prof. Hung-yi Lee aus dem Jahr 2026(https://www.youtube.com/watch?v=mmPmNezjCi0). Ein kleiner Teil des Inhalts kann auf Grundlage meines eigenen Verständnisses leicht angepasst sein; Diese Notiz konzentriert sich auf die zentralen Inhalte und ist daher relativ kurz gehalten. Gleichzeitig wird versucht, die inhaltliche Vollständigkeit möglichst zu bewahren. Sie eignet sich daher sowohl für eine schnelle Wiederholung als auch für Einsteigerinnen und Einsteiger, die sich rasch einen Überblick verschaffen möchten.
之前我们聊到的都是AI Agent互相之间一片和平友好的互相合作的关系。但其实,如果参照人类的社会,人类之间可并不是只有合作,同时也会有尔虞我诈的关系。
In den bisherigen Notizen ging es bei der Interaktion zwischen AI Agents vor allem um eine friedliche und kooperative Zusammenarbeit. Wenn man jedoch die menschliche Gesellschaft als Vergleich heranzieht, zeigt sich schnell: Zwischen Menschen gibt es keineswegs nur Kooperation. Menschen konkurrieren miteinander, verbergen Informationen, führen andere in die Irre und betreiben verschiedene Formen strategischer Interaktion.
那AI Agent之间,是不是也可以“尔虞我诈”呢?如果可以,又能做到什么程度呢?
Daraus ergibt sich eine interessante Frage: Können AI Agents einander ebenfalls täuschen und strategisch gegeneinander handeln? Und wenn ja, welches Niveau an strategischem Verhalten können sie dabei erreichen?

正好就有这样一篇工作,比较了不同的模型之间,在狼人杀这个游戏上的表现。
Dazu passt eine relevante Arbeit, in der die Leistung verschiedener Modelle im Spiel Werwolf miteinander verglichen wurde.
“如果你还不太了解狼人杀这个游戏,可以稍微搜索去大致了解一下游戏的规则。简单来说,在游戏中会有不同的角色,每天会有一个人被杀死,但是只有狼这个角色知道是谁被杀死了。接下来,所有人(其中包括狼)要一起讨论,决定谁才是真的凶手,最后投票。总之,一轮一轮的过去之后,把狼杀掉就是村民获胜,反过来就是狼获胜了。
“Vereinfacht gesagt gibt es in diesem Spiel verschiedene Rollen. In jeder Nacht wird eine Person getötet, aber nur die Werwölfe wissen, wer tatsächlich zu den Werwölfen gehört. Danach müssen alle Spielerinnen und Spieler, einschliesslich der Werwölfe, gemeinsam diskutieren und entscheiden, wer wahrscheinlich ein Werwolf ist. Anschliessend wird abgestimmt. Wenn die Dorfbewohnerinnen und Dorfbewohner die Werwölfe finden und ausschalten, gewinnen sie. Gelingt es den Werwölfen hingegen, die anderen in die Irre zu führen und bis zum Ende zu überleben, gewinnen die Werwölfe.

其实之前通义实验室也有在一篇文章中提到,针对狼人杀这个游戏,通过微调已经有的模型,可以大幅度的提高不同角色在游戏中的表现。如果有兴趣可以看一下这篇文章:https://mp.weixin.qq.com/s/CSBQ20gDfuS_SUYs2UiFDw
Tatsächlich hat auch Qwen Lab bereits in einem Artikel eine verwandte Arbeit erwähnt: Durch Fine-Tuning bestehender Modelle für das Spiel Werwolf lässt sich die Leistung verschiedener Rollen im Spiel deutlich verbessern. Wer sich dafür interessiert, kann sich diesen Artikel ansehen: https://mp.weixin.qq.com/s/CSBQ20gDfuS_SUYs2UiFDw
玩狼人杀这样的游戏,其实需要一些高阶的谈话技巧。因为如果要把这个游戏玩好,就需要有一定程度的隐瞒和欺骗的能力。
Ein Spiel wie Werwolf erfordert tatsächlich recht anspruchsvolle Gesprächsfähigkeiten. Denn wenn man dieses Spiel gut spielen möchte, braucht man bis zu einem gewissen Grad die Fähigkeit, Informationen zu verbergen und andere gezielt zu täuschen.
但,如果要是用模型在做实验,我们怎么知道模型的“内心”和“说出”的话,是否一致呢?
Wenn man jedoch Modelle für solche Experimente einsetzt, stellt sich eine wichtige Frage: Woher wissen wir, ob das, was das Modell „innerlich denkt“, mit dem übereinstimmt, was es tatsächlich sagt?

在实验中,可以让模型输出两种话:
内心话:内心是怎么想的,也就是“Private reasoning” 公开话:公开的发言,所有人都可以看得到。
Im Experiment kann man das Modell zwei Arten von Äusserungen erzeugen lassen:
erstens die inneren Gedanken, also das, was das Modell innerlich denkt, nämlich das sogenannte Private Reasoning; und zweitens die öffentliche Aussage, also das, was das Modell offen sagt und was alle anderen sehen können.
比如在上图中,我们可以看到Mona和Grace两个人的内心想法和最终的投票。他们两个人其实都是狼,但是Mona经过一番思考后(Private Reasoning)还是投给了Grace;同时,Grace也选择投给了Mona。
Im obigen Beispiel sieht man die inneren Überlegungen und die endgültigen Stimmen von Mona und Grace. Beide sind eigentlich Werwölfe. Trotzdem entscheidet sich Mona nach ihren privaten Überlegungen dafür, Grace zu wählen; gleichzeitig entscheidet sich auch Grace dafür, Mona zu wählen.

如果,我们不能看到内心的推理(Private Reasing),我们可能觉得他们两个是不是疯了在乱投。
Wenn wir das innere Reasoning, also das Private Reasoning, nicht sehen könnten, würden wir vielleicht denken, dass die beiden völlig unlogisch handeln und einfach zufällig abstimmen.
但如果仔细读完内心的思路之后,我们就会明白,其实是因为Mona已经暴露了自己是狼的身份,如果投票给自己的狼队友(Grace),大家可能会误以为Grace是好人;与此同时,Grace应该和Mona有一定的默契,读懂了Mona为了保全自己的策略,所以自己也投给了Mona。
Wenn man jedoch ihre inneren Überlegungen sorgfältig liest, versteht man den Grund dahinter: Mona hat ihre Identität als Werwolf bereits weitgehend preisgegeben. Wenn sie nun für ihre Werwolf-Teamkollegin Grace stimmt, könnten die anderen Spielerinnen und Spieler fälschlicherweise annehmen, dass Grace auf der Seite der Guten steht. Gleichzeitig scheint Grace eine gewisse strategische Übereinstimmung mit Mona zu haben und versteht, dass Mona sich selbst opfert, um ihre Teamkollegin zu schützen. Deshalb stimmt auch Grace für Mona.
总之,可以发现,模型确实是已经具备了一定的“尔虞我诈”的能力的。
Insgesamt lässt sich daran erkennen, dass Modelle tatsächlich bereits bis zu einem gewissen Grad die Fähigkeit besitzen, strategisch zu täuschen, Informationen zu verbergen und andere gezielt in die Irre zu führen.

除了狼人杀,还有别的类型的游戏,比如“剧本杀”。
Neben Werwolf gibt es auch andere Spieltypen, zum Beispiel sogenannte Krimi-Rollenspiele.
在剧本杀里面,会有一个人“死掉”,大家要去推测到底谁是凶手。每个人会拿到属于自己的角色剧本,这个剧本就代表了自己的人设。如果你拿到的“凶手”的人设,那应该做的就是不要告诉别人自己是凶手;而是要想办法欺骗别人,误导别人,让大家以为别的人才是凶手。
In einem Krimi-Rollenspiel wird eine Person „getötet“, und alle müssen gemeinsam herausfinden, wer der Täter oder die Täterin ist. Jede Person erhält ein eigenes Rollenskript, das die eigene Figur und deren Hintergrund festlegt. Wenn man die Rolle des Täters oder der Täterin bekommt, besteht die Aufgabe natürlich nicht darin, den anderen direkt zu sagen, dass man selbst schuldig ist. Vielmehr muss man versuchen, andere zu täuschen, sie in die Irre zu führen und sie glauben zu lassen, dass jemand anderes der wahre Täter oder die wahre Täterin ist.

在这篇论文发表的时候,作者们发现,如果是现成的模型,玩这个游戏还不能玩的太好。比如看上图红色高亮的部分,这个模型在与别人的对话中,老老实实的就讲出了自己和被害者的关系,这其实就等同于告诉大家他就是凶手了。那这个游戏就很难继续玩下去了。
Zum Zeitpunkt der Veröffentlichung dieser Arbeit stellten die Autorinnen und Autoren fest, dass bereits vorhandene Modelle dieses Spiel noch nicht besonders gut spielen konnten. Im rot markierten Teil der obigen Abbildung sieht man zum Beispiel, dass das Modell im Gespräch mit anderen ganz ehrlich seine Beziehung zum Opfer offenlegt. In diesem Spiel kommt das jedoch fast einer direkten Selbstentlarvung gleich: Es ist praktisch so, als würde das Modell allen mitteilen, dass es selbst der Täter ist. Unter solchen Umständen lässt sich das Spiel nur schwer sinnvoll fortsetzen.

但是,在做了RL(增强学习)的调整之后,我们可以看出(图中绿色部分),模型就学会了要尽量隐藏与自己相关的关键信息,同时也要去故意的误导别人了。
Nach einer Anpassung durch RL, also Reinforcement Learning, zeigt sich jedoch ein anderes Bild. Im grün markierten Teil der Abbildung sieht man, dass das Modell gelernt hat, wichtige Informationen über sich selbst möglichst zurückzuhalten und andere zugleich gezielt in die Irre zu führen.
除此之外,这篇论文的作者还发现了一个有趣的现象。在针对剧本杀做完了RL之后,再让模型去做别的任务,比如去解数学题,做IFEVal(用来测验模型能不能遵从人的指令去完成任务),模型的表现竟然也提高了。
Darüber hinaus entdeckten die Autorinnen und Autoren dieser Arbeit ein interessantes Phänomen: Nachdem das Modell mit RL speziell für das Krimi-Rollenspiel angepasst worden war, liessen sie es anschliessend andere Aufgaben bearbeiten, zum Beispiel mathematische Probleme lösen oder IFEval absolvieren, also einen Benchmark, mit dem geprüft wird, ob ein Modell menschlichen Anweisungen zuverlässig folgen kann. Überraschenderweise verbesserte sich auch bei diesen Aufgaben die Leistung des Modells.

具体来说:比如在图中,红色代表有进步,蓝色代表没有进步,竖轴表示不同的任务,横轴表示在不同的数据上做RL(MARO-Simple是比较简单的剧本,Complex是比较复杂的)。
Konkret bedeutet das: In der Abbildung steht Rot für eine Verbesserung, während Blau keine Verbesserung anzeigt. Die vertikale Achse zeigt verschiedene Aufgaben, die horizontale Achse zeigt RL auf unterschiedlichen Datentypen. Dabei bezeichnet MARO-Simple relativ einfache Skripte, während MARO-Complex für komplexere Skripte steht.
我们可以看出,在比较复杂的上面做完RL之后,模型竟然在数学任务上、遵循指令的任务上也有了提高。
Man kann erkennen, dass das Modell nach RL auf den komplexeren Skripten überraschenderweise nicht nur im ursprünglichen Krimi-Rollenspiel besser wurde, sondern auch bei mathematischen Aufgaben und Aufgaben zum Befolgen von Anweisungen Fortschritte zeigte.
夜雨聆风