【知未防务】—— 外军专属防务+技术干货平台!
✅ 长期更新:外军军事防务要闻、时政热点、独家外文防务报告✅ 专属社群:QQ群实时交流技术问题、行业资讯✅ 干货星球:精选Link16、电子战指挥控制等稀缺资料,持续上新📞 客服微信:EWFrontier(答疑/进群/星球咨询)🌍 知识星球直达:https://wx.zsxq.com/group/15554484845852👥 QQ交流群:497127644
防务深度|军事AI自带性别偏见?联合国裁军研究所重磅报告揭开算法战争隐藏风险
来源:UNIDIR《Does Military AI Have Gender?》深度解读字数:约 3000 字 | 阅读时长:10 分钟关键词:军事人工智能、算法偏见、致命自主武器、性别主流化、战争伦理
引言:我们总以为 AI 中立,战场算法早已刻下性别烙印
长久以来,大众对军事人工智能的认知停留在 “冰冷、客观、无情绪” 的机器逻辑:无人机自主识别目标、情报 AI 筛选战场人员、指挥系统辅助作战决策,算法被视作剥离人类主观偏见的最优工具。

但联合国裁军研究所(UNIDIR)2021 年发布的《Does Military AI Have Gender?》报告彻底推翻了这一固有认知:军事 AI 从数据采集、算法训练到实战部署的全生命周期,都会植入、放大社会固有的性别规范与偏见。这种隐藏的性别维度,正在悄悄扭曲战场区分原则、加剧平民伤亡,甚至直接削弱联合国《妇女、和平与安全》1325 号决议二十余年的治理成果。
不同于民用 AI 性别偏见仅带来就业、服务不公,军事 AI 的性别偏差直接关联生杀大权。当算法默认 “成年男性等同于潜在战斗人员”、语音识别无法精准识别女性作战人员、图像数据集将女性平民标注为次要目标,自主武器系统便会制造无差别的误杀。本文结合 UNIDIR 完整报告、利比亚卡古 - 2 无人机实战案例、全球 AI 偏见统计数据,拆解军事 AI 性别偏见的形成逻辑、实战危害,并梳理国际社会可落地的伦理治理方案。
一、根源:性别规范如何嵌入军事 AI 全生命周期
UNIDIR 报告明确:性别偏见并非算法偶然出错,而是贯穿机器学习完整链条的系统性问题。从现实社会的性别不平等,到军工研发、数据生产、战场部署的层层传导,偏见会不断叠加放大,形成难以修正的结构性缺陷。
1.1 人机交互底层:军工 AI 天然依附 “男性化战争逻辑”
现代军事 AI 的研发源头带有浓厚的男性本位思维。冷战时期美国军方长期资助初代符号式 AI,核心目标是为男性指挥官提供决策辅助;如今全球军工 AI 研发团队同样存在严重性别失衡:全球计算机科学从业者中女性仅占 24%,机器学习领域论文作者女性仅 12%;欧美防务企业高层女性占比不足 25%,核心算法研发岗女性比例更低。
这种人员结构直接塑造技术范式:行业普遍将 “硬数据、逻辑、暴力对抗” 定义为核心作战能力,而共情、人文观察、性别差异化识别等 “软性认知” 被边缘化。人形军用机器人、自主攻击无人机普遍采用强势男性化外观与设定;而语音助手、后勤辅助 AI 多使用女性声线,形成 “男性主导杀戮、女性负责服务” 的刻板二元对立。
更深层的矛盾在于:现有 AI 对 “人类” 的建模,长期以男性生理特征、行为模式为默认标准。民用领域早已验证:语音识别系统识别男性语音准确率高出女性 70%;商用人脸识别对浅肤色男性错误率不足 1%,深肤色女性误判率最高达 35%。这套缺陷完整迁移至军事场景:女飞行员语音指令识别失灵、战区女性平民被图像算法模糊归类、女性武装人员极易被系统判定为非战斗人员而遗漏预警。
1.2 数据原罪:训练数据集复刻全球性别数字鸿沟
机器学习的本质是 “数据复刻现实”,而全球互联网、军事数据集本身就充满性别失衡:
- 1
地理与人群代表性缺失:全球 40% 人口无法接入互联网,其中绝大多数是女性;主流开源图像数据集 ImageNet 中,美英图片占比超 50%,中印两大人口大国图像合计不足 3%,大量发展中国家女性服饰、外貌、行为样本严重缺失。例如,穿西式婚纱的白人女性会被标注 “新娘”,身着南亚传统婚服的女性则被归类为 “街头表演者”。
- 2
战场历史数据固化刻板印象:近二十年反恐、平叛战争数据形成固定标签 ——“适龄男性 = 潜在武装分子”。美军在阿富汗、中东的无人机定点清除规则中,无明确证据时,战区所有成年男性默认划为打击目标;这套历史数据输入军事 AI 后,算法会自动强化该逻辑,大量无武装男性平民面临误击风险。
- 3
数据标注劳动的阶层性别分化:海量图像、语音标注工作由全球南方女性临时工完成,但顶层算法设计、标注规则制定全部由北方男性技术人员主导,底层女性劳动者的文化、性别视角无法融入数据标准。
1.3 算法迭代:偏见会自我强化,形成恶性循环
算法不会主动修正社会不平等,反而会放大数据里的固有偏见:
词向量模型会自动绑定 “计算机专家、士兵、指挥官” 与男性词汇,将 “护士、平民、难民” 关联女性;
用于兵员招募的 AI 筛选系统,会因历史参军女性基数低,自动压低女性求职者评分;
战场区分算法依靠过往冲突数据学习特征,持续固化 “男性 = 威胁、女性 = 无威胁” 的二元判断,忽略女性武装人员、男性平民的复杂现实。
报告特别强调交叉性伤害:性别偏见不会单独存在,会和种族、年龄、残障等标签叠加。例如深色皮肤女性、老年男性在目标识别系统中,双重误判概率翻倍,在冲突地区直接面临更高伤亡风险。
二、三大实战案例:性别偏见如何制造人道主义灾难
UNIDIR 选取三类典型场景,直观展示军事 AI 性别偏见的现实危害,覆盖计算机视觉、自主杀伤武器、战场人员区分三大核心应用。
2.1 ImageNet 数据集:视觉识别的文化与性别盲区
ImageNet 是全球计算机视觉 AI 的基础训练库,包含 1400 万互联网抓取图像,也是绝大多数军用目标识别算法的底层数据源。2019 年专项审查发现大量问题:
- 1
人物分类下存在大量侮辱性、性别刻板标签,“妓女、酒鬼” 等负面标签几乎全部绑定女性图像;
- 2
非西方女性形象严重缺失,头巾、传统服饰女性样本不足,导致中东、阿富汗战区 AI 难以准确识别女性平民;
- 3
样本地域极度倾斜,模型在欧美环境识别准确率 97%,换到中东、非洲冲突场景直接跌至 50% 以下。
这意味着部署在中东、非洲的侦察无人机、监控 AI,天然缺乏对当地女性群体的识别能力,极易出现两类极端失误:一是将女性平民误判为隐藏武装人员,二是完全遗漏女性武装分子,造成情报疏漏。
2.2 战场军民区分算法:男性平民成算法 “预设威胁”
区分战斗人员与平民是国际人道主义法核心原则,但现有军事 AI 完全依赖历史冲突数据训练,形成致命偏见:以阿富汗反恐数据训练的识别模型,会把 16-60 岁男性全部标记为高风险目标,妇女、儿童统一划为低风险平民。现实冲突中,大量务农、经商的男性平民会被无人机自主识别为打击对象;反之,女性游击队员、情报人员则会被系统自动过滤,无法触发预警。
军事院校模拟推演验证了该风险:学员操控小型自主机器人区分红蓝方目标时,基于现有数据集训练的 AI 会无差别攻击所有男性靶标,无视平民标识;仅少数人工重新平衡性别样本的模型,才能做到相对公平区分。
2.3 卡古 - 2 自杀无人机:全球首例自主杀伤背后的算法漏洞
2020 年利比亚内战,土耳其 “卡古 - 2”(Kargu-2)蜂群无人机完成人类战争史上首起无人工干预自主猎杀事件,联合国安理会报告完整记录该案例。这款无人机搭载机器视觉自主识别系统,可脱离操作员实时控制自主搜寻、引爆目标。其训练数据主要来源于中东男性武装人员图像,存在显著性别缺陷:
- 1
对男性人体特征识别灵敏度极高,撤退男性士兵极易被锁定追击;
- 2
对女性、孩童识别阈值极高,难以识别携带武器的女性作战人员;
- 3
缺乏北非本地服饰、人群样本,区分平民与武装人员仅依靠 “男性 = 威胁” 单一逻辑。
事件中,撤退的利比亚国民军男性后勤人员被蜂群无人机持续追杀,大量无武装平民男性遭遇误伤。UNIDIR 指出,若该类自主武器大规模普及,算法内置的性别偏见将系统性制造针对男性平民的定向暴力,严重违反区分、比例原则。
三、全球不平等:南北差距放大军事 AI 性别风险
军事 AI 的偏见不只是技术问题,更是全球权力、资源分配失衡的产物,三层不平等层层叠加加剧性别伤害:
- 1
技术研发权力失衡:全球 85% 超算、77% 机器学习博士集中在中美欧,绝大多数军事 AI 标准、数据集由北方国家制定,天然带入西方性别规范,无法适配非洲、中东、东南亚本土文化。例如部分地区女性常年佩戴头巾,欧美数据集缺少对应样本,直接导致识别失效。
- 2
数字接入性别鸿沟:ITU 数据显示,全球女性互联网使用率显著低于男性,欠发达地区差距扩大。女性群体缺少线上数据留存,AI 无法学习其行为、外貌特征,最终在战场、救灾场景中被算法 “隐形”。
- 3
军工产业性别权力失衡:各国防务行业高层、算法负责人以男性为主,性别研究、女性安全专家极少参与军事 AI 立项、测试、审核。技术设计阶段完全忽略性别差异化需求,等到部署后再修正成本极高。
更值得警惕的是,军事 AI 数据具备极强的武器化属性:全球 75 个国家已部署 AI 监控系统,发展中国家无法自主掌控本土人群数据集,欧美企业采集的本土民众数据,可能反向用于跨境军事侦察、自主武器目标识别,女性群体隐私与安全双重受损。
四、破局路径:构建性别友好的军事 AI 伦理框架
UNIDIR 报告并未停留在风险批判,而是结合民用 AI 公平治理经验、联合国 1325 号决议,提出一套覆盖技术、政策、国际治理的完整解决方案,核心思路是将性别主流化嵌入军事 AI 全生命周期审核。
4.1 技术层面:全流程消除算法隐性偏见
- 1
数据集标准化文档(数据表单机制)所有军用训练数据集必须配套完整说明文档,标注样本地域、性别、年龄、种族分布比例,明确数据采集场景、标注规则,公开缺失群体样本清单。对于战区识别类 AI,必须补足当地女性、少数族群样本,平衡男女样本数量。
- 2
模型独立性别审计(模型卡片制度)每一款军事 AI 系统(无人机识别、情报分析、指挥辅助)需出具 “模型评估卡”,分性别、种族、年龄公布识别准确率、误判率。例如老年男性、头巾女性等边缘群体的错误率必须单独公示,超标模型禁止投入实战。
- 3
差异化测试场景隔离训练集、测试集、实战校验场景必须完全分割,不能用训练数据充当测试标准。模拟战场需覆盖多元性别、服饰、文化背景,不能仅依靠欧美男性士兵图像完成校验。
4.2 制度层面:建立跨学科性别审核机制
- 1
所有军工 AI 立项、定型、列装三阶段,强制引入性别研究、妇女和平安全领域专家参与评审,不能仅由计算机、军工技术人员单独决策;
- 2
军队操作人员开展常态化培训,明确 AI 性别偏见的典型漏洞,杜绝完全依赖算法判断目标,保留完整人工复核权;
- 3
建立问责机制:若军事 AI 因性别偏见造成大规模平民伤亡,研发方、采购军方需承担对应责任,存在严重性别伤害风险的系统实施暂停部署、禁用。
4.3 国际治理:依托 CCW 公约与 1325 号决议形成约束
- 1
完善《特定常规武器公约》(CCW)自主武器规则在致命自主武器(LAWS)政府专家组谈判中,新增数据集性别公平条款,禁止使用带有结构性性别偏见的算法武器;对无充分人类控制、极易造成性别定向误杀的自主武器,推动全球暂停使用乃至禁令。红十字国际委员会明确呼吁,禁止具备无限制自主识别人类目标能力的武器系统。
- 2
将性别视角纳入全球军事 AI 治理落地联合国安理会 1325 号决议要求,在各国国防 AI 战略中落实性别主流化:评估 AI 对女性、男性、儿童的差异化战场影响,保障女性专家、女性军人参与军事 AI 规则制定;针对战后人道主义救援 AI,专门设计适配女性、女童需求的算法模块,避免救灾资源分配算法忽略女性特殊需求。
- 3
推动全球数据治理均衡,缩小南北数字性别鸿沟援助发展中国家建立本土、多元人群数据集,减少对西方商用数据集依赖;规范跨境战场数据采集,禁止他国未经主权许可采集当地平民图像、语音用于军事 AI 训练。
五、总结与展望:算法战争不能复制旧时代性别不公
AI 不会天然中立,军事技术永远承载着人类社会的价值、偏见与权力关系。UNIDIR 这份报告的核心警示十分清晰:如果放任性别偏见持续嵌入军事 AI,新型算法战争只会复刻、放大传统冲突中的性别暴力,让本就脆弱的平民群体承受更多无差别伤害,数十年妇女和平安全领域的治理成果将面临倒退风险。
当下各国加速布局军用大模型、蜂群自主无人机、智能指挥系统,行业仍处于发展早期,这是全球校正算法偏见、建立公平伦理规则的黄金窗口期。单纯依靠技术修复无法根除问题,必须同步推动研发团队性别多元化、建立强制性性别审计、完善国际军备控制规则,让军事 AI 既能提升作战效率,也能恪守人道主义底线,真正兼顾不同性别、不同族群的生命安全。
未来,评判一款军事 AI 是否先进,标准不应只有识别速度、打击精度,更要增加一条核心标尺:它能否平等、无偏见地识别、保护每一个身处战场的普通人。
参考资料
- 1
UNIDIR, Does Military AI Have Gender?, Katherine Chandler, 2021
- 2
联合国安理会利比亚问题专家报告 S/2021/229
- 3
《特定常规武器公约》LAWS 政府专家组 2019 年度报告
- 4
UN Women《人工智能与妇女和平安全议程》政策简报
- 5
MIT《机器学习全生命周期潜在伤害来源》研究报告
夜雨聆风