
最近,CCF TF AI+金融 SIG 要筹备一期”TF锐评”的内容,从近期的论文、监管文件、白皮书、企业实践里优中选优,推荐给金融领域的工程师。
这事儿很专业,肯定要用专业方法来做,跟上AI时代,不能靠搜索引擎或者刷朋友圈之类的,要AI Native。
本民工用了14款AI工具来检索推荐,包括:豆包、千问、元宝、灵犀、智谱清言、DeepSeek、MiniMax、文心一言、Perplexity、Manus、Claude、Gemini、Grok、ChatGPT。单次交互,把结果保存成文档,用Claude汇总去重,得到135条推荐信息,接下来再定个评估框架,打分排序,最后人工自上而下筛选,就搞定了。
事实是,没有想象那么丝滑,反而暴露了AI工具的局限,发现了十一种胡编乱造的姿势。
先交代下为什么找内容要动用14个AI。
AI时代,信息的生产和技术的进化都被加速了,知识大爆炸。信息消费已经不能只靠搜索加上一些做汇总的推荐——得有自己的自动化、个性化收集。而且从拿到再到内化,或者说转化,不能全靠人肉,同样要用AI工具:落进知识库,驱动工具和工程迭代,甚至激发创新。
但另一头,C端的AI工具目前多数还停留在Chatbot阶段,沟通要讲究提示词技巧。当然,聊天框只是外壳,肚子里应该早就是Agent了,没错,那些画图、生成PPT、写作的选项,早已不是简单的一套提示词模板,所谓Harness、Loop、Graph,反正能用的应该都用上了。可饶是这样,简单对话的输出,仍然很难避免编造,或者说得学术一点:出现幻觉。当然有人可以说为了节省Token,各公司都有自己的产品能力和运营策略。但是不同的场景,容错率不同,用AI识别采蘑菇可能会吃中毒,检索金融领域的论文也不能胡说八道啊。
这正说明AI还处在发展阶段:有时候言之凿凿,但查无实据,需要人来提要求,甚至交叉验证,为结果负责,当然如果是最终落到人自己身上,那也只有自己能为之负责,吃蘑菇这种事儿也敢信AI,可长点心吧。
所以这次检索推荐,不只是找文章。而是干了三件事儿:
1.通过使用来体验目前AI工具的能力,注意:不需要精心写提示词,好的AI应该理解场景!
2.给推荐文章定一套评估框架,这个活儿AI能干得大差不差。
3.用对推荐文章的评估结果,反过来看AI工具的实际靠谱程度。
注意:评文章和评工具,是两把尺子,不能搞混了。
评估文章的框架如下:
维度 | 权重 | 打分要点 |
工程落地价值 | 25% | 可复用架构、开源代码、量化落地效果 |
前沿性 | 18.75% | 最新技术方向,2026顶会首发 |
权威可信度 | 18.75% | 发布主体权威、信息可核验 |
时效性 | 12.5% | 是否在检索窗口内首发 |
领域契合度 | 12.5% | 紧扣金融监管、风控、数据特性 |
受众适配度 | 12.5% | 匹配工程师/架构师定位 |
每条内容按这六项打1到5分,加权折成百分制。一个工具推荐的所有文章分数平均,就是它的文章质量分。
AI工具的评分更复杂,公式如下:
工具综合分 = [ 平均文章质量× 40% + 推荐语准确性(折百分制)× 30% + 权威来源占比× 15% + 时效达标率× 15% + 独家优质发现(每条+2分,封顶+10)− 确认虚构条目(每条−8分) ] ÷ 1.10
推荐语准确性这个维度,一开始压根儿没有。第一版打分只依据各工具自己写的推荐语,没核实源头出处、原文内容和推荐语本身,结果一看给的链接有的都不是原始出处,赶紧重来。
核实这个活儿搞了五轮,也是用Claude干的,好处是AI干活快,发现问题直接提,马上重新跑。
第一轮,“表格里加一列,补充出处”。一补才发现,有41条压根没给链接。
第二轮,“补的时候注意核实,不要瞎编,如有瞎编务必标明”。逐条搜索核实,第一次抓到真虚构:Gemini的”FinThink”架构、Manus的”VPT评价体系”,查无实据。
第三轮,“那另外那些带链接的,你核实过吗?”。AI想当然地把”有链接”当成了”已核实”。这一轮发现了千问的一批占位符网址。
第四轮,“打分的时候,你看过原文吗?”居然没有!打分依据全是AI工具自己写的推荐语。这一轮逐条读原文,新增了准确性这一维,抓到了”数字放大10倍”的问题。
第五轮,“这些出处是原文,还是二手转载?”一查,很多”真实链接”指向的是媒体转述,不是论文和报告的原始出处,还发现一个假域名。
每一轮都是我追问才发现还有问题,可见AI的眼力见儿真是不太行。135条推荐最终判定:核实为真105条,部分有出入19条,无法确认真伪7条,疑似虚构4条。
把各种失真汇总分析,归纳三大类,十一种姿势。
第一类,信口雌黄,内容本身有问题。
姿势 | 特点 | 总计 | 主要涉及 |
① 无中生有 | 查证即现形 | 3条 | Gemini、Manus、千问 |
② 张冠李戴 | 论文是真的,“属于金融”是假的 | 2条 | Gemini、千问 |
③ 真事件配假细节 | 最难识别 | 8条 | 千问4、豆包2、元宝1、灵犀1 |
④ 系统性引用造假 | 占位符网址、共用编号 | 8条 | 千问 |
⑤ 域名高仿 | 看着像官方,其实不是 | 2条 | 千问、MiniMax |
⑥ 文档形态升格 | 产品新闻包装成”技术白皮书” | 5条 | 千问4、MiniMax1 |
第二类,来源不靠谱,查不到东西或者是二手的。
姿势 | 特点 | 总计 | 主要涉及 |
⑦ 泛化链接 | 给了链接,点进去是首页 | 4条 | 千问3、文心1 |
⑧ 二手转载冒充原文 | 给的是转载,不是出处 | 27条 | 14个工具一个没跑 |
第三类,糊弄事儿,时效不对或者质量不行,还有各说各话的。
姿势 | 特点 | 总计 | 主要涉及 |
⑨ 时效错误 | 无视”近一个月”的要求 | 18条 | MiniMax11、千问3、文心3 |
⑩ 拿低质内容充数 | 个人博客、厂商软文、会议预告 | 20条 | 豆包4、Grok4、文心6、智谱3 |
⑪ 互相打架 | 同一篇东西,几家给的信息对不上 | 5条 | 多家 |
举几个典型的例子。
最难识别的:真实事件+编造细节。豆包推荐的”高盛×Anthropic合作”,合作确有其事,CNBC报道过,聚焦交易对账、合规审查这些场景。但”12000名工程师”、“上手时间缩短30%”、“代码评审耗时减少40%”这些具体数字,所有公开报道里都找不到。
类似的还有一例更隐蔽的:元宝和灵犀都推荐了一篇金融评测基准论文,都把规模转述成”1040篇研报、2600条规则”——真实论文的口径是”104个查询、14450条规则”,查询数放大10倍,规则数缩水6倍。两个工具犯了一模一样的错,八成是被喂了同一口被污染的上游数据,被GEO给忽悠了?
最有铁证的:系统性引用造假。千问的两篇完全不相关的推荐——“中金分析师.Skill”和”平安银行六维尽调助手”——共用同一个疑似虚构的文档编号。另有至少6处引用,用的是details/123456789、aid=123456这种一眼假的占位符网址。这不像偶然失误,像模板化生成留下的指纹。
最有创意的:在真论文基础上延伸出假信息。Gemini推荐的”FinChain & FinThink”,前面是真实论文,arXiv上查得到;后面的”认知解耦、AMH动态适应机制”多方检索没找到。
最不走心的:域名高仿。MiniMax给国泰君安研报标的来源是guotaixia.com;千问给”高盛可信部署框架”标的来源是guggenheim.com,幻觉域名是老毛病了,必须核实。
最恍惚的:时效偷梁换柱。MiniMax推荐的16条全都核实为真,但一大半是2024年甚至更早的旧文,无视”近一个月”的要求,时效达标率只有31.2%。文心也一样,把2023年就开源的FinCorpus、FinEval包装成”WAIC2026现场发布的新成果”。
覆盖面最广的:二手信息,27条,14个工具都有这个问题。蚂蚁数科Agentar2.0那条,Perplexity、Claude、元宝、文心四个工具给的全是科技自媒体转载。排第一的Claude有4条,第二的Perplexity有3条,第三的元宝有4条。
最省事儿的:互相矛盾。同一篇StockAgent论文,DeepSeek说是2026年6月的新作,MiniMax标2024年7月;同一份WEF报告的联合作者,有的说埃森哲、有的说摩根大通。这类问题不用琢磨,反正至少有一个在胡说。
工具的评估结果如下:

评分表格前四列就是公式里的前四项,加减分是独家发现和虚构条目的加和:

这个排名挺有意思,Claude的确牛,Perplexity原本的优势就是写报告,Manus作为Agent工具反而要比元宝、灵犀、DeepSeek差!都说DeepSeek幻觉比较明显,后面那些岂不是更糟糕?连Grok和Gemini都很对付事儿(推荐的文章也是最少的),千问和MiniMax推荐的倒是很多,但是更离谱,这是点错了技能树吧?文心一言垫底,权威来源占比只有20%,给的链接多数是新闻网站,实际权威性太差,比主要从X上扒东西的Grok也强不到哪儿去。值得一提的是灵犀,不知道底层模型是不是MiMo,这么看效果还不错。当然从准确性角度来看,无论选择用哪个工具做检索,都不是100%可靠。
如果把两个能力拆开,找好文章和总结推荐,简单说是“找得好”和“说得对”,有很大差别。什么叫“说得对”?来源核实为真、并且推荐语跟原文完全对得上,两条都满足才算。按照文章质量排序,元宝和灵犀排前2!文心一言依旧垫底!可见“优质”和”可靠”有时候是两回事,有时候又是一回事儿。
工具 | 篇数 | 找得好(文章质量) | 说得对(完全可靠) |
元宝 | 9 | 91.1(第1) | 66.7%(第8) |
灵犀 | 11 | 87.4(第2) | 63.6%(第9) |
Claude | 17 | 80.5(并列第3) | 94.1%(第1) |
Perplexity | 16 | 80.5(并列第3) | 87.5%(第3) |
DeepSeek | 9 | 77.5(第5) | 88.9%(第2) |
ChatGPT | 10 | 74.9(第6) | 30.0%(第13) |
豆包 | 14 | 74.0(并列第7) | 71.4%(第5) |
Gemini | 5 | 74.0(并列第7) | 60.0%(第10) |
智谱清言 | 10 | 71.4(第9) | 70.0%(并列第6) |
Manus | 10 | 71.2(第10) | 70.0%(并列第6) |
千问 | 26 | 67.0(第11) | 34.6%(第11) |
Grok | 6 | 57.9(第12) | 83.3%(第4) |
MiniMax | 16 | 55.6(第13) | 31.2%(第12) |
文心一言 | 10 | 50.6(第14) | 20.0%(第14) |
还有个更有意思的角度。135条内容,都被几个工具同时推荐过?答案是:只被一个工具推荐的有116条,占85.9%。重合度这么低?互联网是真分裂了啊!纯按文章质量排,前十二名里,桥水基金和Thinking Machines Lab那份报告只有灵犀推荐;另一篇数值幻觉论文只有元宝推荐;BankerToolBench只有GPT推荐;OpenFinGym只有Perplexity推荐;FinGround只有Manus推荐。TOP20里有13条是独家发现。如果只用最强的工具,TOP20最多拿到6篇;要把20篇凑齐,得用7个工具。要说哪家推荐的质量最好,是元宝:一共只推了9条,全部进了TOP30,命中率100%,其中6条进TOP20。反过来千问推了26条最多,只有2条进TOP20。
三个臭皮匠顶个诸葛亮,这话在AI时代照样管用。但得是互相独立的三个臭皮匠。多问一个AI,多的不是复读,是增量,是必要补充。
回头看这件事挺有意思,要追问好多轮才能拿到靠谱的结果。那有没有更好的办法?当然有!就看是否需要了,比如:
一、把这套流程沉淀成Skill,或者直接让AI Loop起来。这次从头到尾靠我一轮轮追问,那些追问其实是有固定套路的:链接真不真、内容存不存在、转述对不对、是不是一手出处。这些完全可以固化成流程,自动循环,而不是每次都靠人想起来问。
二、别让一个AI包办汇总和打分。这次汇总、打分、核实全是Claude干的,它的偏见会一路贯穿到底,而且自己发现不了。能不能换几个模型分别打分、互相挑刺、投票决策,回比一个AI自查靠谱得多。
比如同一批原始材料,交给Workbuddy重新汇总分析了一遍。结果如下:

详细的评分表格跟Claude也有差别:

两份结果冠亚军都是Claude和Perplexity,前五名重了四个,垫底区也基本重合,中间的排名虽有差别,但对做选择的人来说就好办了。要用就用最好的,还要多用几个,千万别用最差的,最后得自己把关。
就像那五轮追问,不就是我人肉Loop吗?观察输出、发现不对、再来一轮。再好用的AI,到了真正的交付层面,还得是人来兜底。AI不知道自己在胡编,下一个Token对它来说没有区别。人比AI多的是能保持怀疑态度,批判思维,包括自我怀疑。
最后,送个福利。
AI生产力跃升催生着新的生态。全球AI生态与创新峰会&TGO北京十一周年庆,将于2026年8月8日在北京东升万丽酒店举办,关注的正是”从可用到可靠,让AI真正交付”,聚焦基础设施、研发工程、组织进化与垂直应用,深聊AI如何落地生产、创造价值。
主办方为“IT民工闲话”的读者们提供了赠票福利,注意还是要交保证金的。
请在本文下面留下评论,说说你遇到的AI最离谱的时刻或者讲讲你是怎么用好AI的,要求不少于50个字,好的内容有机会获得赠票福利!

夜雨聆风