先看三个真实翻车现场。
让模型拍一段中国传统音乐表演,出来的乐器、画面上的文字,跟真正的中国传统对不上。让它拍尼日利亚婚礼,宾客的衣服和仪式用品全是"通用款",看不出一点尼日利亚味。让它拍日本将棋对弈,棋盘棋子直接变成了西洋国际象棋。
画面本身都没毛病,光影、动作、清晰度样样在线——这正是问题所在。文生视频已经真到肉眼难辨,画面越真,文化错误就越隐蔽,也越扎眼。一条给海外市场做的视频,服饰错了、仪式错了,本地人一眼就识破,轻则是笑话,重则是冒犯。
arXiv 2608.01942 这篇《CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation》,就是给这件事造了一套完整的考卷:12 个国家、1000 道题、7 个模型同场竞技,专考文生视频的文化理解。一作 Xianjing Han 来自南洋理工大学,通讯作者 Bin Zhu 来自新加坡管理大学,合作方还有 Centrale Supélec 和剑桥大学。我完整读了一遍,这篇的价值不在某一个分数,而在于它第一次把"AI 懂不懂文化"从感觉变成了可量化的工程问题。
以前的评测为什么测不到文化
文生视频的评测并不缺,VBench、EvalCrafter 这些主流基准一直在用,但它们盯的是画质、动作流畅度、物理合理性、贴题度。还有专门考物理常识的、考机器人可信度的,各管一摊。
文化这个维度,视频侧基本没人系统测过。文生图片那边倒是有人做过,ViSAGe、CUBE-1K 都考过文化概念——但图片是静的,看不出动作对不对,也听不到声音对不对。视频里的文化是活的:仪式有流程,场景有音乐,招牌上有文字。这块空白,就是 CultureVidBench 要填的坑。
填坑的第一步是出考卷,而考卷好不好,直接决定后面所有结论的可信度。这篇论文在出卷上下的功夫,值得单独讲。
一张覆盖 12 国的考卷是怎么出出来的
先选国家。 作者借用了世界价值观调查(World Values Survey)的文化地图——一个学界常用的文化分区工具,把全世界分成 8 个文化圈,比如儒家圈、英语国家圈、非洲伊斯兰圈。每个圈挑代表,凑齐 12 国、横跨 6 大洲。注意这个名单的刻意搭配:既有美国、中国、印度这种网上素材泛滥的高曝光国家,也有埃塞俄比亚、尼日利亚、马来西亚这种低资源国家。后面会看到,这个搭配直接考出了全文最重要的结论之一。
再造题。 作者把文化拆成三大类:物质文化(食物、服饰、建筑、装饰,看得见摸得着的东西)、社会实践与表演(问候、饮食、舞蹈、运动、宗教活动,人在做的事)、仪式典礼(婚礼、葬礼,一整套流程)。三大类细分 14 个方面,从各国文化资料里收集 828 个文化元素,最终打磨成 1000 条提示词——物质 270 条、实践 386 条、仪式 344 条,每条平均 12.8 个英文单词。
题目质量有人工把关。 每条提示词套模板生成:物质文化是"谁 + 做什么动作 + 带什么文化元素 + 在哪个国家",比如"一位女士在巴西的餐厅里把黑豆饭(feijoada)盛到盘子里";仪式类因为是一套流程,拆成子活动,比如中国茶俗婚礼拆成跪父母、奉茶、接红包三步。候选题目还要过两位人类标注员的手,核对说法自不自然、文化准不准、画面拍不拍得出来。

整张流水线如图:828 个文化元素 → 1000 条提示词 → 7 个模型各跑一遍生成 7000 条视频 → 真人 + AI 两套评委打分。考生是 4 个开源模型(LTX-2.3-22B、Cosmos-Predict-2.5-14B、HunyuanVideo-1.5、Wan-2.2-14B)加 3 个闭源模型(Kling-3.0、Veo-3.1-Fast、阿里的 HappyHorse-1.0)。
怎么打分:两个大问题拆成 8 个小项
评分体系设计得很清楚,每条视频回答两个大问题:

- 文化搞对没有
(文化忠实度):该有的文化元素出现没有(文化元素对齐)?有没有混进别国的东西(文化一致性)? - 视频本身好不好
(语义贴合 + 感知质量):主体、动作贴题吗?画面真实吗?
每项 0 到 1 分。中间还单拎出一个板块考多模态文化渲染:画面里的文字、背景里的声音——日本场景的汉字招牌、婚礼上的传统乐曲,都在这一栏。把文字和声音单列,是这套考卷的独到之处,后面会考出大问题。
评委有两套。真人评审挑了 168 道题(14 方面 × 12 国),每题由 3 个本国观众打 5 级分再平均——成本高,但这是金标准。AI 评委用的是作者设计的目标显式(target-explicit)协议,说人话就是不让 AI 凭感觉打分:第一步告诉它这题考什么,第二步让它只从视频里找相关证据,第三步基于证据打分。这套协议能不能站住,后面有专门一张表检验。
成绩单:开源和闭源之间隔了一道沟
第 6 页的 Table 1 是全场最重要的一张表。先看文化元素对齐这一列的真人评分:

开源 4 个模型全在 0.359 到 0.485 之间,闭源 3 个直接跳到 0.701 到 0.766。最高是 Veo-3.1-Fast 的 0.766,HappyHorse-1.0 是 0.742,Kling-3.0 是 0.701;开源最强的 Wan-2.2-14B 只有 0.485,还比闭源最弱的低 0.2 分。一道肉眼可见的沟。
但同一张表藏着另一个关键信息:画质和贴题度这些通用能力,大家都不差,基本都在 0.49 以上,最高摸到 0.808。把两件事放在一起看,结论很硬——模型不是不会拍视频,是真不懂文化。 文化差和生成能力差是两回事,这正是这套考卷把它们拆开考的意义。
全场最拉胯的一列:文字渲染
Table 1 里还有一列比文化对齐更难看:画面文字渲染。

开源组最高的 Cosmos-Predict-2.5-14B 才 0.178,HunyuanVideo-1.5 低到 0.102;闭源组好一些,最高的 HappyHorse-1.0 也只有 0.434——全场冠军都不到满分的一半。横幅、对联、招牌上的本地文字,AI 基本写不对。网上流传的"AI 画字鬼画符",第一次有了硬指标。实用结论:视频里但凡涉及本地文字,发布前一定人工校对,这一条目前没有模型能替你兜底。
AI 评委能信吗:Table 2 的对赌
用 AI 当评委是为了把评测规模化(真人评审 168 题已经是重金投入),但 AI 打分能信吗?Table 2 用国家平均的 Kendall τ 和 Spearman ρ 回答这个问题——越接近 1,说明 AI 和人类排名越一致。

小模型基本不行:ViCLIP 这种图文相似度小模型只有 0.137,Qwen3-VL-32B 上到 0.427。GPT-5.4 用上目标显式协议后,文化元素对齐这项从 0.519 提到 0.546,协议本身确实有效。作者最终选定的评委是 Gemini-3.1-Pro:这项 0.529,虽然单项略低于 GPT-5.4,但文化各维度综合最稳(文化一致性 0.521、文字渲染 0.527),作者用它给全部 7000 条视频打分。
关键参考线是人类评委彼此之间的相关性:0.591。也就是说,最好的 AI 评委在文化维度上已经逼近人类评委之间的默契程度——文化评测从"必须请人",变成"可以先让 AI 过一遍"。要泼一盆冷水的是 Realism 和 Visual Quality 这种主观维度,人类自己一致性就低,AI 也跑不出彩,这类分看看就好。
国家与国家之间:一道 0.3 的鸿沟
第 7 页 Figure 5 把分数按国家摊开,这张表(附录里有精确数字)可能是全文对从业者最有用的一页:

美国 0.874 几乎霸榜,中国 0.778,意大利 0.763,印度 0.760;往下是荷兰 0.721、巴西 0.718、日本 0.713、新西兰 0.698;再往下俄罗斯 0.669、尼日利亚 0.636、马来西亚 0.629;垫底是埃塞俄比亚 0.556。
最高最低差了 0.3 以上。作者还算了各维度跨国家的分散度:文化对齐类维度在 0.3 上下,而贴题度这种通用能力只差 0.07 左右。也就是说,所有模型都能把"两个人下棋"拍得不走样,但碰到埃塞俄比亚的肩膀问候、日本将棋这种文化细节,分数立刻拉开。规律直白得有点扎心:网上素材越多的国家,AI 考得越好。这不是模型聪明不聪明的问题,是训练数据的偏置。
Figure 6 还补了一刀:开源模型在埃塞俄比亚、马来西亚、尼日利亚这些低资源国家掉分更狠,闭源模型也掉,只是底子厚、掉完仍然领先。
什么文化最难拍:物件容易,流程难
Figure 8 按文化类别把 14 个方面排开:物质文化整体得分最高,社会实践与表演其次,仪式典礼最难。文化分相对语义分的跌幅,小至庆祝类的 -15.6%,大到服饰类的 -30.9%。
道理很朴素:拍对一个物件是静态视觉问题,拍对一整套有先后、有互动的时空流程,是另一个量级的难度。
Figure 7 的翻车实拍是最好的注脚:日本将棋,HappyHorse-1.0 场景拍对了,棋子上的字全是错的;埃塞俄比亚东正教画十字,所有模型都拍不出指尖捏合的手势;马来西亚开斋节(Hari Raya)的装饰,HunyuanVideo-1.5 直接渲染成了圣诞节风格——高资源文化的图案,直接把低资源文化的场景给"夺舍"了。
读完值得提醒的几点
第一,别拿总分当能力。这篇论文最大的方法论贡献,就是把"拍得好"和"懂得对"拆开考。一个模型画质 0.8、文化 0.4,用来做本土内容很香,做出海内容就是雷。选模型要看你要什么。
第二,闭源的领先是实打实的,但别神化。0.766 意味着闭源冠军也有近两成多的文化元素没拍对;文字渲染 0.434 更说明没有模型能全链路托付。多文化项目,本地化审核这一环省不掉。
第三,国家得分表值得收藏。做哪个市场的内容,就先查哪个国家的分数:美国、中国、印度这种高资源市场,主流模型基本能信任;埃塞俄比亚、马来西亚这类市场,0.55-0.63 的分数意味着近一半文化细节是错的,必须人工兜底。作者没有给出每个模型在每个国家的完整矩阵之外的更多因果分析,比如到底是训练数据量还是数据配比起决定作用,这一点论文没展开。
第四,AI 评委这个方向比这个分数更重要。1000 道题 × 7 个模型这种规模的评测,靠真人永远做不完。目标显式协议(先列目标、再找证据、后打分)把 AI 评委的相关性推到逼近人类互评水平,这个套路大概率会成为下一波多模态评测的标配。
一句话总结:论拍视频,AI 已经毕业了;论懂文化,它还在补课——而这篇论文给补课进度装了第一张成绩单。
论文:CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
arXiv: https://arxiv.org/abs/2608.01942
项目主页: https://hanxjing.github.io/CultureVidBench/
夜雨聆风