乐于分享
好东西不私藏

[AI安全论文] (52)NDSS26 Chimera:利用多智能体大模型自动模拟内部威胁和ATT&CK映射

[AI安全论文] (52)NDSS26 Chimera:利用多智能体大模型自动模拟内部威胁和ATT&CK映射

2024年4月28日是Eastmount的安全星球 —— 『网络攻防和AI安全之家』正式创建和运营的日子。该星球目前主营业务为 安全零基础答疑、安全技术分享、AI安全技术分享、AI安全论文交流、威胁情报每日推送、网络攻防技术总结、系统安全技术实战、面试求职、安全考研考博、简历修改及润色、学术交流及答疑、人脉触达、认知提升等。下面是星球的新人券,欢迎新老博友和朋友加入,一起分享更多安全知识,比较良心的星球,非常适合初学者和换安全专业的读者学习。

《娜璋带你读论文》系列主要是督促自己阅读优秀论文及听取学术讲座,并分享给大家,希望您喜欢。由于作者的英文水平和学术能力不高,需要不断提升,所以还请大家批评指正,非常欢迎大家给我留言评论,学术路上期待与您前行,加油。

前一篇博客介绍了基于启发式优化器的入侵检测系统。本文将带来NDSS 2026的一篇论文,该论文提出 Chimera,一个基于多智能体大语言模型的内部威胁自动仿真框架,将企业员工、组织协作、正常业务流程和内部攻击行为统一建模,并生成包含六类日志模态、约250亿条日志的 ChimeraLog 数据集,用于支持内部威胁检测方法的训练、评测和分布偏移研究。注意,由于我们团队还在不断成长和学习中,写得不好的地方还请海涵,未来希望能多读多分享,这些大佬真值得我们学习。fighting!

文章目录

      • 一.摘要
      • 二.研究背景:为什么需要 Chimera?
        • 1.内部威胁检测的核心难点
        • 2.现有内部威胁数据集的四类瓶颈
      • 三.核心思想:不是“生成攻击日志”,而是“模拟一个企业社会”
      • 四.Chimera 方法框架
        • 1.Overview
        • 2.组织画像:将业务语境映射为可执行环境
        • 3.Agent 社会
        • 4.威胁场景仿真
        • 5.记忆机制
        • 6.多模态日志采集:从用户动作到系统痕迹
      • 五.ChimeraLog 数据集
      • 六.实验设计与评价指标
        • 1.评测协议
        • 2.数据真实性
        • 3.行为分布
        • 4.检测难度
        • 5.分布偏移(泛化能力)
      • 七.总结与读后感
      原文作者:Jiongchi Yu, Xiaofei Xie, Qiang Hu, Yuhan Ma, Ziming Zhao原文标题:Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation作者机构 :Singapore Management University;Tianjin University;Zhejiang University原文链接:https://www.ndss-symposium.org/ndss-paper/chimera-harnessing-multi-agent-llms-for-automatic-insider-threat-simulation/发表期刊:NDSS 2026笔记作者 :贵州大学 杨子轩&杨秀璋

          一.摘要

          内部威胁是一类重大且持续存在的安全风险,但在复杂企业环境中仍然难以检测,因为恶意活动通常隐藏在细微的用户行为之中。尽管基于机器学习的内部威胁检测(Insider Threat Detection, ITD)技术已经显示出良好效果,但其有效性从根本上受到高质量、真实训练数据缺乏的制约。这一挑战源于企业内部数据的高度敏感性,使其很少能够被获取;同时也源于现有数据集的局限性,即公开数据集通常规模较小,而合成数据集往往缺乏充分的泛化能力、丰富的语义上下文和真实的行为模式。

          为应对这一挑战,我们提出了 Chimera,一个基于大语言模型(LLM)的多智能体框架,能够自动模拟良性和恶意内部人员活动,并监控多样化企业环境中的综合系统日志。Chimera 将每个智能体建模为具有细粒度角色的个体员工,并结合小组会议、双人交互和自主日程安排,以捕捉真实的组织动态。基于从真实事件中抽象出的 15 类内部攻击类型,我们将 Chimera 部署在三种具有代表性的数据敏感型组织场景中,并构建了一个新的数据集 ChimeraLog,用于支持内部威胁检测方法的开发与评估。

          我们通过全面的人工研究和定量分析对 ChimeraLog 进行评估,证明了其多样性和真实性。针对现有内部威胁检测方法的实验表明,这些方法在 ChimeraLog 上的检测性能显著低于在现有内部威胁检测数据集上的表现,说明 ChimeraLog 是一个更具挑战性且更接近真实环境的基准数据集。尽管存在分布偏移,在 ChimeraLog 上训练的内部威胁检测模型仍表现出较强的泛化能力,突出了基于大语言模型的多智能体仿真在推动内部威胁检测研究方面的实际价值。

          二.研究背景

          1.内部威胁检测的核心难点

          内部威胁是企业安全中长期存在且难以检测的问题。与外部攻击者不同,内部人员通常拥有合法账号、熟悉业务流程和系统权限,其恶意行为往往混杂在正常工作活动之中。论文指出,内部威胁可以表现为横向移动、数据外泄、IT破坏、欺诈、窃取活动和权限提升等多种形式,具有合法权限掩护、行为隐蔽、攻击链持续时间长等特点。

          论文关注的是日志驱动的内部威胁检测,即通过登录、邮件、网页浏览、文件操作、网络流量和系统调用等日志识别异常行为。现有机器学习方法虽然在内部威胁检测中取得了一定效果,但其性能高度依赖大规模、高质量、细粒度标注的数据集。


          2.现有内部威胁数据集的四类瓶颈

          论文将内部威胁检测数据集的不足概括为四个方面。

          • 隐私约束:
             企业内部日志包含业务、人员和资产信息,难以对外共享。
          • 公开数据不够真实:
             典型合成数据集(如 CERT)多由规则和人工脚本产生,语义上下文、角色差异与真实协作过程不足;不少数据集也缺少网络流量、系统调用等系统层日志。
          • 采集与标注成本高:
             真实企业每天可产生海量活动,长期采集、标注、脱敏和维护成本很高。
          • 适应性差:
             组织软件栈、人员行为和业务流程会变化,导致旧数据上的检测器遇到分布偏移而失效。

          因此,论文的核心问题是:能否在不接触真实企业敏感数据的前提下,自动生成既真实、又可标注、还可随组织场景变化而更新的内部威胁日志数据?


          三.核心思想:模拟企业

          Chimera 的创新点不在于简单让 LLM 编写几条攻击日志,而是构建一个可运行的企业仿真环境。每个员工都由 LLM Agent 表示,具有角色、人格、任务、工具和记忆;多个员工之间可以开会、通信、浏览网页、编辑文件、执行代码;恶意 Agent 则在正常工作流中嵌入攻击行为。

          作者认为,一个实用的自动数据生成框架应同时具备四项能力:

          • 根据领域软件、通信协议和组织目标灵活配置场景;
          • 生成符合真实工作节奏的良性员工行为;
          • 让攻击者根据上下文自适应地实施不同内部威胁;
          • 采集完整日志并自动产生准确标签,避免大规模人工标注。

          这种思路使生成日志具有更强的组织上下文、时序连续性和跨模态一致性。论文图1展示了自动化内部威胁仿真的总体场景:管理者分派任务,员工 Agent 在 OA 系统、邮件系统、数据库和服务器中执行活动,同时日志系统采集登录、邮件、网页、文件、网络流量和系统调用等痕迹

          组织与日志模型:

          • 员工按开发者、分析师、管理员等明确角色运行,受基于角色的访问控制约束。
          • 记录四类应用层日志:登录、邮件、网页浏览、文件操作;以及两类系统层日志:网络流量、系统调用。
          • 每个恶意动作都映射至 MITRE ATT&CK 战术与技术,保证行为和日志之间的可追溯关系。

          四.Chimera方法框架

          1.Overview

          图2和算法1给出了Chimera 的完整工作流,主要包括三个阶段:组织画像、Agent 社会构建和威胁场景仿真。算法 1 进一步形式化为四个环节:组织画像、Agent 社会构建、威胁场景仿真、统一日志采集。

          • 组织画像(Organization Profiling):
             若用户未给出完整配置,LLM 根据组织类型和业务目标补全员工、角色、服务和系统环境。
          • Agent 社会构建(Agent Society Construction):
             为每位员工建立 Agent bundle,注入职位、人格、账户与工具;为攻击者额外分配攻击目标。
          • 威胁场景仿真(Threat Scenario Simulation):
             以天为单位生成计划,以时隙为单位并行执行;员工在沟通后会更新后续日程,攻击者也会据此调整攻击时机。
          • 统一日志(Unified Logging):
             集中采集日志,关联活动、时间戳和攻击标签。

          Chimera 的输入为:

          X = (E, R, S, G, T)E:员工集合;R:员工角色;S:系统环境;G:组织目标;T:仿真时长

          输出是应用层和系统层日志,以及其对应的攻击标签与上下文。


          2.组织画像:将业务语境映射为可执行环境

          组织结构包含员工数量、岗位分配和高层业务目标;系统设置则包含操作系统、邮件服务器、办公协作栈、浏览器等。作者强调,即使是软件版本或系统配置的微小差异,也会改变系统层日志的表现。

          Chimera 支持两种模式:

          • 用户指定配置:
             用于复现某一领域或组织的具体环境;
          • LLM 自动生成画像:
             当细节缺失时,使用结构化模板补足合理的组织设定。

          为控制实验,组织被部署到预配置企业服务的标准化容器中。这样既能保证可复现性,也为后续改变组织环境、研究分布偏移提供了可配置接口。


          3.Agent 社会

          Chimera 并非由一个 Agent 直接扮演员工,而是为每个员工配置一组协作 Agent:

          • User Agent:
             负责生成和维护工作计划;
          • Assistant Agent:
             调用终端、浏览器、文件操作等工具,将计划转化为环境内的具体活动。

          每个 bundle 持有统一的员工画像:姓名、部门、角色、容器 ID 与账户等。攻击员工在此基础上获得攻击目标,但仍须继续完成常规职责,从而让恶意迹象自然地混入正常工作流。

          为引入受控的个体差异,作者采用 MBTI 轻量人格描述,影响决策倾向、沟通频率、写作口吻与风险偏好。这里的人格并不是心理测量结论,而是让 Agent 的协作节奏和行为分布不至于完全同质。


          4.威胁场景仿真

          Chimera 的威胁仿真不是先生成攻击、再补正常日志,而是让所有 Agent 在统一组织目标下推进工作。正常员工生成日计划并执行任务;沟通发生后,后续计划会被动态更新;攻击 Agent 则根据目标员工的日程和上下文选择合适时机嵌入攻击活动。

          论文将计划划分为多层次结构:

          • 月计划 → 周计划 → 日计划 → 时隙任务执行

          每个时间步中,Agent 根据当前任务、系统状态和历史记忆执行操作。攻击行为在日志采集时自动标注,因此无需事后人工逐条标注。


          5.记忆机制

          为避免 Agent 每天“失忆”,Chimera 使用长短期混合记忆:

          • 长期记忆:
             每位 Agent 在每日结束时生成报告,记录已完成任务、未完成目标和沟通内容;摘要在次日输入,用于延续工作策略。
          • 短期记忆:
             保留最近 5 轮交互(日程变更、沟通、工具调用)的滑动窗口。

          这种设计的作用是让月度仿真中出现持续项目、迭代讨论和逐步推进的攻击链,而不是每天重复无关的独立行为。


          6.多模态日志采集:从用户动作到系统痕迹

          论文图3展示了 ChimeraLog 的多模态日志采集过程。日志分为应用层和系统层两类。

          层次
          日志类型
          主要内容
          应用层
          登录日志
          用户、容器、登录/登出时间
          应用层
          邮件通信
          发件人、收件人、主题、正文、附件
          应用层
          网页浏览
          URL、访问时间、网页内容
          应用层
          文件操作
          文件创建、读取、写入、修改内容
          系统层
          网络流量
          pcap 数据包、协议字段、流量痕迹
          系统层
          系统调用
          Sysdig/scap 记录的进程、系统调用和参数

          此外,Chimera 还可以记录 Agent 的内部操作,例如工具调用、中间产物、生成代码片段、文档修改和 LLM 回复。这使得日志不仅有外部行为痕迹,还有可追溯的上下文链条。


          五.ChimeraLog数据集

          论文在三个数据敏感型组织中部署 Chimera。每个场景包含 20 名员工 Agent,连续仿真一个月。这三个场景覆盖了科技、金融、医疗三类高敏感数据环境,对应不同业务流程、访问模式和内部风险。

          场景
          组织目标
          典型内部威胁
          Technology Company
          开发第三人称射击游戏
          源码窃取、IT破坏
          Financial Corporation
          设计市场中性统计套利基金
          交易算法窃取、欺诈、未授权交易
          Medical Institution
          采集电子健康记录并分析季节性流感趋势
          非法访问病历、出售健康信息、破坏医疗系统

          ChimeraLog 总计约 250 亿条日志,包括约 200 亿条良性日志 和 50 亿条攻击日志。论文中进一步给出了各类日志规模:

          日志类型
          数量
          登录记录
          约 0.2 billion
          邮件记录
          约 0.6 billion
          网页浏览记录
          约 0.8 billion
          文件操作记录
          约 0.4 billion
          网络数据包
          约 4.5 billion
          系统日志/系统调用
          约 18.2 billion
          总计
          约 25 billion

          数据集使用 5W1H 内部威胁分类框架,从公共案例中抽象 12 类攻击,并加入 3 个混合攻击场景。总体覆盖:

          • 恶意内部人员:IP 窃取与系统/应用破坏;
          • 冒充者:欺诈、IP 窃取与跨内部/外部的凭据滥用;
          • 非故意内部人员:数据泄露、权限控制错误和相关风险;
          • 混合场景:数据外泄与系统接管等持续、多步骤行为。

          每个攻击都映射为 MITRE ATT&CK Enterprise TTP(如表3所示)。论文以 IP 窃取为例给出三阶段链条:利用同事或凭据取得访问、通过内部邮件等社会工程谋求高权限、再通过物理介质等方式外传敏感文件。该映射同时指定可观测痕迹和对应数据源(邮件、登录、文件操作、网络流量、系统日志)。


          六.实验设计与评价指标

          1.评测协议

          质量评测:

          • 与 CERT v6.2、TWOS 比较;
          • 每个数据集抽取 100 条应用层日志,覆盖登录、邮件、网页历史和文件操作;
          • 每组样本包含 50 条良性与 50 条攻击日志;
          • 5 位具有至少 5 年安全与 AI 经验的独立专家按 5 分 Likert 量表评估真实性和实用性。

          ITD 基线评测:

          • 每个数据集保留 10% 测试集,其余样本按 80:20 划分训练和验证;
          • 以用户-日(user-day)行为特征统一不同数据集;
          • 评估 SVM、Temporal CNN、GCN 与 DS-IID(LSTM + Autoencoder)四种代表性检测方法;
          • 重复 5 次实验并报告均值,采用 Precision、Recall 与 F1-score。

          底层模型与实现: 作者在实验中使用 Gemini-2.0-Flash、GPT-4o、DeepSeek V3,并基于 CAMEL 与 OWL 实现 Agent 协作架构。


          2.数据真实性

          图5 展示了专家真实性评分结果。ChimeraLog 的平均真实性得分为 4.20,TWOS 为 4.25,CERT 为 1.78。专家一致性较高,Krippendorff’s alpha 为 0.87。这说明 ChimeraLog 在可读应用层日志的真实感上接近由真实人类参与生成的 TWOS,而明显优于规则合成的 CERT。

          图6给出了三类数据集中邮件通信内容的对比。Chimera 生成的邮件具有明确业务语境、专业沟通语气和连续上下文;CERT 邮件虽然语法可读,但语义浅、上下文弱;TWOS 邮件来自真实交互,但由于脱敏处理,内容较短且碎片化。


          3.行为分布

          图7 比较了 ChimeraLog、TWOS 和 CERT 的日常良性员工活动分布。ChimeraLog 呈现明显工作日节律,包括早晨启动、午间下降和晚间收敛。相比之下,TWOS 受竞赛环境影响更强,CERT 则呈现较明显的规则化模式。


          4.检测难度

          Table IV 给出了四种 ITD 方法在 ChimeraLog 三个场景和 CERT 上的检测结果。

          可以看出,四种模型在 CERT 上普遍取得很高 F1,但在 ChimeraLog 上明显下降。金融场景尤其困难,说明金融业务中的内部威胁更容易与正常行为混淆。


          5.分布偏移(泛化能力)

          Table V 展示了跨数据集分布偏移实验。论文发现,当模型从一个数据集迁移到另一个数据集时,性能显著下降。尤其是仅在 CERT 上训练的模型,迁移到 Chimera 场景时往往产生接近 100% 的误报率。

          Table VI 比较了不同基础模型生成数据的统计特征。论文发现,GPT-4o 生成的事件更多、通信更丰富,整体质量最好。Gemini 在原子任务首次执行中失败率最高,论文报告其初次失败率为 22.5%,且约 85% 的失败来自错误工具调用或虚构工具名。DeepSeek 则可能出现反复修改文档、工作延续到深夜的非收敛推理循环。


          七.总结与读后感

          Chimera 提出了一种基于多智能体大语言模型的内部威胁自动仿真框架。其核心思想不是简单生成攻击日志,而是先构建一个包含组织目标、员工角色、人格特征、任务日程、群体会议和工具执行的企业仿真环境,再让恶意内部人员、冒充者或非故意内部人员在正常业务流程中嵌入攻击行为。论文最终构建了 ChimeraLog 数据集,覆盖科技、金融和医疗三类数据敏感组织场景,包含登录、邮件、网页浏览、文件操作、网络流量和系统调用六类日志模态,并基于 15 类真实内部攻击场景生成约 250 亿条带细粒度标签的日志数据。

          未来工作:

          • 认知与组织层级真实性
            智能体层面的真实性(人格、记忆与动机建模) ;组织层级结构( 部门、分支机构与跨团队动态协作)。
          • 自动化红队
            完全自动化的对抗智能体、自适应多阶段攻击策略演化,例如 APT 攻击。
          • 协同演化防御
            集成防御智能体,用于自演化的攻防动态建模;分析员反馈与交互式干预。

          本论文值得我们借鉴的地方包括:

          (1)多智能体可用于构建“组织级安全仿真环境”Chimera 将员工建模为具有角色、人格、记忆和工具能力的 Agent,并通过会议、邮件、日程更新和任务执行模拟真实组织协作。这种设计启发我们,在安全和威胁情报领域,不能只模拟单个攻击行为,而应构建“组织目标—业务流程—用户行为—攻击嵌入—日志采集”的完整场景。对于靶场建设、APT溯源、供应链攻击仿真和内部威胁检测,这种多智能体组织仿真模式具有较强借鉴价值。

          (2) 多智能体适合生成带上下文的安全与威胁情报数据Chimera 的攻击行为不是孤立插入,而是与员工日常工作、权限边界、沟通内容和系统操作共同演化,并进一步映射到 MITRE ATT&CK TTP。这个思路可拓展到威胁情报知识图谱构建中:由不同 Agent 扮演攻击者、防御者、情报分析员和业务用户,自动生成攻击链、行为证据、日志痕迹、IOC、TTP 和处置建议,从而形成可解释、可追溯、可标注的安全数据资产。

          (3) 实验评估设计和框架图值得参考论文没有只做单一模型性能比较,而是从数据真实性、行为复杂度、检测难度、跨场景泛化和基础模型影响多个角度进行评估。例如,专家评分用于验证日志真实性,行为熵和序列复杂度用于衡量行为多样性,SVM、CNN、GCN、DS-IID 用于评估检测难度,跨数据集实验用于分析分布偏移,OpenAI、Gemini、DeepSeek 对比用于分析基础模型对数据质量的影响。这个评估框架对安全数据集、威胁情报生成和智能体安全系统研究都很有参考价值。

          (4) 未来可拓展方向后续可以进一步构建攻防共演化的多智能体威胁情报仿真平台和威胁推理。在 Chimera 现有员工 Agent 和攻击 Agent 基础上,引入防御 Agent、SOC 分析员 Agent 和威胁情报 Agent,使系统不仅能生成攻击行为和日志,还能自动完成告警研判、攻击链还原、TTP 标注、处置建议生成和防御策略调整。这样可将多智能体从“内部威胁数据生成”拓展到“攻击—检测—溯源—响应—情报推理”的闭环安全智能体系统。

          『网络攻防和AI安全之家』目前收到了很多博友、朋友和老师的支持和点赞,并且保持每周七次更新,尤其是一些看了我文章多年的老粉,购买来感谢,真的很感动,类目。未来,我将分享更多高质量文章,更多安全干货,真心帮助到大家。虽然起步晚,但贵在坚持,像十多年如一日的博客分享那样,脚踏实地,只争朝夕。继续加油,再次感谢!尤其是一些看了我文章多年的老粉,购买来感谢,真的很感动,类目。未来,我将分享更多高质量文章,更多安全干货,真心帮助到大家。虽然起步晚,但贵在坚持,像十多年如一日的博客分享那样,脚踏实地,只争朝夕。继续加油,再次感谢!

          (By:Eastmount 2026-08-27 周四夜于贵阳)

          前文推荐: