ARTICLE · 1065679
CAIRN如何追踪自主决策的AI恶意软件
一、当恶意软件开始“投票决策”
Cisco Talos发布了一款名为CAIRN(Cognitive Artifact Intelligence Research Network,认知工件情报研究网络)的开源工具包,并在同一次披露中展示了一个令人警觉的发现:一个名为CLOSEDQUORUM的Windows植入程序,将战术指挥与控制决策“外包”给了四个商业大语言模型——DeepSeek、Qwen、Mistral和Google Gemini。
这不是简单的“调用AI生成命令”。CLOSEDQUORUM的核心机制是一个多数投票决策循环:它将感染系统的上下文信息嵌入结构化提示,分别发送给四个模型,要求每个模型从一组受限动作中做出选择——窃取凭证、建立持久化、注入代码,或收集加密货币钱包。所有响应收集完毕后,通过 interModelDiscussion 函数进行多数投票,胜出的动作被本地执行,执行结果则通过Discord webhook加密回传。
Talos明确表示,当前公开样本是一个惰性模板,包含占位符API密钥和虚拟Discord webhook,尚未确认在野部署。但静态分析揭示的架构本身已经足够说明问题:一个完整的自主决策闭环——收集系统信息 → 构造提示 → 多模型查询 → 投票仲裁 → 执行恶意动作 → 回传结果——不依赖任何人类操作员或专用C2服务器即可持续运行。
二、CAIRN的方法论:在元数据中寻找“认知指纹”
CAIRN的设计逻辑建立在一个核心洞察之上:AI集成会在代码中留下可观察的痕迹。Talos安全研究员Ryan Fetterman将此比作“指纹”——调用LLM不是免费的,它会在字符串、导入表、网络配置和行为模式中留下持久的工件。
这些“认知工件”包括:提示模板、provider API端点(如 api.openai.com、api.anthropic.com、api.deepseek.com)、API密钥前缀、Python AI框架依赖(LangChain、LiteLLM)、本地推理运行时(Ollama、llama.cpp),以及agent风格的tool-call语法和越狱术语。
CAIRN的技术栈由三个相互增强的层构成:
采集层使用最多24个过滤器,从提取字符串、杀毒标签和沙箱行为元数据中筛选候选样本。结果存入SQLite语料库,导入时自动运行YARA规则。
分类层采用三级本体结构:Tier 1识别原始AI工件(端点、函数调用语法);Tier 2加入行为上下文,将工件与AI分析规避或已知C2方法关联;Tier 3通过逆向工程验证的指纹,将样本归因到已确认的恶意软件家族。更新后的规则可回溯扫描本地语料库,实现对历史样本的重新识别。
发现层将关系图谱与语义发现相结合。关系图谱通过共享域名、证书、导入哈希、提交者和AI provider连接样本,揭示变体和攻击基础设施。对于不那么明显的关联,CAIRN从杀毒名称、URL、PE资源和沙箱观察构建元数据文档,使用嵌入、HDBSCAN和UMAP暴露相似样本和离群点。
Talos特别强调了一个重要限制:聚类生成的是线索,而非归因。AI相关字符串在合法软件中日益常见——PyInstaller打包可能暴露整个开发环境,Tauri和Go二进制可能产生结构性匹配——CAIRN的定位是在逆向工程之前缩小大规模集合,而非替代逆向工程。
三、从LAMEHUG到CLOSEDQUORUM:自主化的跃迁
CAIRN的诞生源于一个反差。2025年7月,乌克兰CERT-UA披露了LAMEHUG——首个已知的LLM集成恶意软件,通过Hugging Face API调用Qwen2.5-Coder-32B-Instruct生成Windows命令,被归因于APT28。Fetterman当时预期这将开启一波AI恶意软件的爆发。但一年后做回顾时,他只能找到约九个命名的AI集成恶意软件家族,其中数个还是研究概念验证。
这个“预期的爆发”与“可见的现实”之间的落差,促使他构建了CAIRN,用指纹直接狩猎,而非等待样本被命名。使用CAIRN数月后,Fetterman额外发现了约20个AI集成恶意软件样本,将已知集合扩大了约三倍。
CLOSEDQUORUM是其中最引人注目的发现。与LAMEHUG依赖单一模型获取命令不同,CLOSEDQUORUM将C2阶段的决策权分配给多个模型的面板,通过投票仲裁降低单一模型不可用或输出异常的风险。其架构设计明确指向凭证和加密货币钱包窃取,并实现了Talos所称的“努力位移”——攻击者可让操作在没有持续人工交互的情况下持久运行和演化。
这一趋势并非孤立。Google威胁情报组在2026年5月的报告中记录了PROMPTSPY,一个滥用Gemini API的Android后门,能够解释设备界面状态、生成结构化命令、模拟手势操作,并捕获生物识别数据。Google将此类恶意软件描述为“向自主攻击编排的转变”,模型解释系统状态以动态生成命令并操纵受害环境。
四、防御者的处境与应对方向
AI域名的封锁策略面临根本性困境:合法应用程序使用着与恶意软件相同的API端点。基于域名的阻断既不现实,也不可操作。
Talos建议的检测思路是行为关联:将意外的多provider API流量与LSASS内存访问、进程注入、持久化变更和Discord通信进行关联分析。单一信号可能产生大量误报,但多个信号的共现显著提高了检测的置信度。
从更宏观的防御姿态来看,CAIRN的价值在于将狩猎的起点从“已知恶意软件家族”前移到“认知工件的存在”。当攻击者将决策权交给模型时,防御者也需要在模型留下痕迹的地方建立观测能力。这不是一个检测签名的更新,而是一次检测范式的迁移——从行为签名到认知指纹。