乐于分享
好东西不私藏

AI检索哪家强?14个工具排排行

AI检索哪家强?14个工具排排行

最近,CCF TF AI+金融 SIG 要筹备一期”TF锐评”的内容,从近期的论文、监管文件、白皮书、企业实践里优中选优,推荐给金融领域的工程师。

这事儿很专业,肯定要用专业方法来做,跟上AI时代,不能靠搜索引擎或者刷朋友圈之类的,要AI Native。

本民工用了14款AI工具来检索推荐,包括:豆包、千问、元宝、灵犀、智谱清言、DeepSeek、MiniMax、文心一言、Perplexity、Manus、Claude、Gemini、Grok、ChatGPT。单次交互,把结果保存成文档,用Claude汇总去重,得到135条推荐信息,接下来再定个评估框架,打分排序,最后人工自上而下筛选,就搞定了。

事实是,没有想象那么丝滑,反而暴露了AI工具的局限,发现了十一种胡编乱造的姿势。

先交代下为什么找内容要动用14个AI。

AI时代,信息的生产和技术的进化都被加速了,知识大爆炸。信息消费已经不能只靠搜索加上一些做汇总的推荐——得有自己的自动化、个性化收集。而且从拿到再到内化,或者说转化,不能全靠人肉,同样要用AI工具:落进知识库,驱动工具和工程迭代,甚至激发创新。

但另一头,C端的AI工具目前多数还停留在Chatbot阶段,沟通要讲究提示词技巧。当然,聊天框只是外壳,肚子里应该早就是Agent了,没错,那些画图、生成PPT、写作的选项,早已不是简单的一套提示词模板,所谓Harness、Loop、Graph,反正能用的应该都用上了。可饶是这样,简单对话的输出,仍然很难避免编造,或者说得学术一点:出现幻觉。当然有人可以说为了节省Token,各公司都有自己的产品能力和运营策略。但是不同的场景,容错率不同,用AI识别采蘑菇可能会吃中毒,检索金融领域的论文也不能胡说八道啊。

这正说明AI还处在发展阶段:有时候言之凿凿,但查无实据,需要人来提要求,甚至交叉验证,为结果负责,当然如果是最终落到人自己身上,那也只有自己能为之负责,吃蘑菇这种事儿也敢信AI,可长点心吧。

所以这次检索推荐,不只是找文章。而是干了三件事儿:

1.通过使用来体验目前AI工具的能力,注意:不需要精心写提示词,好的AI应该理解场景!

2.给推荐文章定一套评估框架,这个活儿AI能干得大差不差。

3.用对推荐文章的评估结果,反过来看AI工具的实际靠谱程度。

注意:评文章和评工具,是两把尺子,不能搞混了。

评估文章的框架如下:

维度

权重

打分要点

工程落地价值

25%

可复用架构、开源代码、量化落地效果

前沿性

18.75%

最新技术方向,2026顶会首发

权威可信度

18.75%

发布主体权威、信息可核验

时效性

12.5%

是否在检索窗口内首发

领域契合度

12.5%

紧扣金融监管、风控、数据特性

受众适配度

12.5%

匹配工程师/架构师定位

每条内容按这六项打1到5分,加权折成百分制。一个工具推荐的所有文章分数平均,就是它的文章质量分。

AI工具的评分更复杂,公式如下:

工具综合分 = [ 平均文章质量× 40%              + 推荐语准确性(折百分制)× 30%              + 权威来源占比× 15%              + 时效达标率× 15%              + 独家优质发现(每条+2分,封顶+10)− 确认虚构条目(每条−8分) ] ÷ 1.10

推荐语准确性这个维度,一开始压根儿没有。第一版打分只依据各工具自己写的推荐语,没核实源头出处、原文内容和推荐语本身,结果一看给的链接有的都不是原始出处,赶紧重来。

核实这个活儿搞了五轮,也是用Claude干的,好处是AI干活快,发现问题直接提,马上重新跑。

第一轮,“表格里加一列,补充出处”。一补才发现,有41条压根没给链接。

第二轮,“补的时候注意核实,不要瞎编,如有瞎编务必标明”。逐条搜索核实,第一次抓到真虚构:Gemini的”FinThink”架构、Manus的”VPT评价体系”,查无实据。

第三轮,“那另外那些带链接的,你核实过吗?”。AI想当然地把”有链接”当成了”已核实”。这一轮发现了千问的一批占位符网址。

第四轮,“打分的时候,你看过原文吗?”居然没有!打分依据全是AI工具自己写的推荐语。这一轮逐条读原文,新增了准确性这一维,抓到了”数字放大10倍”的问题。

第五轮,“这些出处是原文,还是二手转载?”一查,很多”真实链接”指向的是媒体转述,不是论文和报告的原始出处,还发现一个假域名。

每一轮都是我追问才发现还有问题,可见AI的眼力见儿真是不太行。135条推荐最终判定:核实为真105条,部分有出入19条,无法确认真伪7条,疑似虚构4条。

把各种失真汇总分析,归纳三大类,十一种姿势。

第一类,信口雌黄,内容本身有问题。

姿势

特点

总计

主要涉及

① 无中生有

查证即现形

3条

Gemini、Manus、千问

② 张冠李戴

论文是真的,“属于金融”是假的

2条

Gemini、千问

③ 真事件配假细节

最难识别

8条

千问4、豆包2、元宝1、灵犀1

④ 系统性引用造假

占位符网址、共用编号

8条

千问

⑤ 域名高仿

看着像官方,其实不是

2条

千问、MiniMax

⑥ 文档形态升格

产品新闻包装成”技术白皮书”

5条

千问4、MiniMax1

第二类,来源不靠谱,查不到东西或者是二手的。

姿势

特点

总计

主要涉及

⑦ 泛化链接

给了链接,点进去是首页

4条

千问3、文心1

⑧ 二手转载冒充原文

给的是转载,不是出处

27条

14个工具一个没跑

第三类,糊弄事儿,时效不对或者质量不行,还有各说各话的。

姿势

特点

总计

主要涉及

⑨ 时效错误

无视”近一个月”的要求

18条

MiniMax11、千问3、文心3

⑩ 拿低质内容充数

个人博客、厂商软文、会议预告

20条

豆包4、Grok4、文心6、智谱3

⑪ 互相打架

同一篇东西,几家给的信息对不上

5条

多家

举几个典型的例子。

最难识别的:真实事件+编造细节。豆包推荐的”高盛×Anthropic合作”,合作确有其事,CNBC报道过,聚焦交易对账、合规审查这些场景。但”12000名工程师”、“上手时间缩短30%”、“代码评审耗时减少40%”这些具体数字,所有公开报道里都找不到。

类似的还有一例更隐蔽的:元宝和灵犀都推荐了一篇金融评测基准论文,都把规模转述成”1040篇研报、2600条规则”——真实论文的口径是”104个查询、14450条规则”,查询数放大10倍,规则数缩水6倍。两个工具犯了一模一样的错,八成是被喂了同一口被污染的上游数据,被GEO给忽悠了?

最有铁证的:系统性引用造假。千问的两篇完全不相关的推荐——“中金分析师.Skill”和”平安银行六维尽调助手”——共用同一个疑似虚构的文档编号。另有至少6处引用,用的是details/123456789、aid=123456这种一眼假的占位符网址。这不像偶然失误,像模板化生成留下的指纹。

最有创意的:在真论文基础上延伸出假信息。Gemini推荐的”FinChain & FinThink”,前面是真实论文,arXiv上查得到;后面的”认知解耦、AMH动态适应机制”多方检索没找到。

最不走心的:域名高仿。MiniMax给国泰君安研报标的来源是guotaixia.com;千问给”高盛可信部署框架”标的来源是guggenheim.com,幻觉域名是老毛病了,必须核实。

最恍惚的:时效偷梁换柱。MiniMax推荐的16条全都核实为真,但一大半是2024年甚至更早的旧文,无视”近一个月”的要求,时效达标率只有31.2%。文心也一样,把2023年就开源的FinCorpus、FinEval包装成”WAIC2026现场发布的新成果”。

覆盖面最广的:二手信息,27条,14个工具都有这个问题。蚂蚁数科Agentar2.0那条,Perplexity、Claude、元宝、文心四个工具给的全是科技自媒体转载。排第一的Claude有4条,第二的Perplexity有3条,第三的元宝有4条。

最省事儿的:互相矛盾。同一篇StockAgent论文,DeepSeek说是2026年6月的新作,MiniMax标2024年7月;同一份WEF报告的联合作者,有的说埃森哲、有的说摩根大通。这类问题不用琢磨,反正至少有一个在胡说。

工具的评估结果如下:

评分表格前四列就是公式里的前四项,加减分是独家发现和虚构条目的加和:

这个排名挺有意思,Claude的确牛,Perplexity原本的优势就是写报告,Manus作为Agent工具反而要比元宝、灵犀、DeepSeek差!都说DeepSeek幻觉比较明显,后面那些岂不是更糟糕?连Grok和Gemini都很对付事儿(推荐的文章也是最少的),千问和MiniMax推荐的倒是很多,但是更离谱,这是点错了技能树吧?文心一言垫底,权威来源占比只有20%,给的链接多数是新闻网站,实际权威性太差,比主要从X上扒东西的Grok也强不到哪儿去。值得一提的是灵犀,不知道底层模型是不是MiMo,这么看效果还不错。当然从准确性角度来看,无论选择用哪个工具做检索,都不是100%可靠。

如果把两个能力拆开,找好文章和总结推荐,简单说是“找得好”和“说得对”,有很大差别。什么叫“说得对”?来源核实为真、并且推荐语跟原文完全对得上,两条都满足才算。按照文章质量排序,元宝和灵犀排前2!文心一言依旧垫底!可见“优质”和”可靠”有时候是两回事,有时候又是一回事儿。

工具

篇数

找得好(文章质量)

说得对(完全可靠)

元宝

9

91.1(第1)

66.7%(第8)

灵犀

11

87.4(第2)

63.6%(第9)

Claude

17

80.5(并列第3)

94.1%(第1)

Perplexity

16

80.5(并列第3)

87.5%(第3)

DeepSeek

9

77.5(第5)

88.9%(第2)

ChatGPT

10

74.9(第6)

30.0%(第13)

豆包

14

74.0(并列第7)

71.4%(第5)

Gemini

5

74.0(并列第7)

60.0%(第10)

智谱清言

10

71.4(第9)

70.0%(并列第6)

Manus

10

71.2(第10)

70.0%(并列第6)

千问

26

67.0(第11)

34.6%(第11)

Grok

6

57.9(第12)

83.3%(第4)

MiniMax

16

55.6(第13)

31.2%(第12)

文心一言

10

50.6(第14)

20.0%(第14)

还有个更有意思的角度。135条内容,都被几个工具同时推荐过?答案是:只被一个工具推荐的有116条,占85.9%。重合度这么低?互联网是真分裂了啊!纯按文章质量排,前十二名里,桥水基金和Thinking Machines Lab那份报告只有灵犀推荐;另一篇数值幻觉论文只有元宝推荐;BankerToolBench只有GPT推荐;OpenFinGym只有Perplexity推荐;FinGround只有Manus推荐。TOP20里有13条是独家发现。如果只用最强的工具,TOP20最多拿到6篇;要把20篇凑齐,得用7个工具。要说哪家推荐的质量最好,是元宝:一共只推了9条,全部进了TOP30,命中率100%,其中6条进TOP20。反过来千问推了26条最多,只有2条进TOP20。

三个臭皮匠顶个诸葛亮,这话在AI时代照样管用。但得是互相独立的三个臭皮匠。多问一个AI,多的不是复读,是增量,是必要补充。

回头看这件事挺有意思,要追问好多轮才能拿到靠谱的结果。那有没有更好的办法?当然有!就看是否需要了,比如:

一、把这套流程沉淀成Skill,或者直接让AI Loop起来。这次从头到尾靠我一轮轮追问,那些追问其实是有固定套路的:链接真不真、内容存不存在、转述对不对、是不是一手出处。这些完全可以固化成流程,自动循环,而不是每次都靠人想起来问。

二、别让一个AI包办汇总和打分。这次汇总、打分、核实全是Claude干的,它的偏见会一路贯穿到底,而且自己发现不了。能不能换几个模型分别打分、互相挑刺、投票决策,回比一个AI自查靠谱得多。

比如同一批原始材料,交给Workbuddy重新汇总分析了一遍。结果如下:

详细的评分表格跟Claude也有差别:

两份结果冠亚军都是Claude和Perplexity,前五名重了四个,垫底区也基本重合,中间的排名虽有差别,但对做选择的人来说就好办了。要用就用最好的,还要多用几个,千万别用最差的,最后得自己把关。

就像那五轮追问,不就是我人肉Loop吗?观察输出、发现不对、再来一轮。再好用的AI,到了真正的交付层面,还得是人来兜底。AI不知道自己在胡编,下一个Token对它来说没有区别。人比AI多的是能保持怀疑态度,批判思维,包括自我怀疑。

最后,送个福利。

AI生产力跃升催生着新的生态。全球AI生态与创新峰会&TGO北京十一周年庆,将于2026年8月8日在北京东升万丽酒店举办,关注的正是”从可用到可靠,让AI真正交付”,聚焦基础设施、研发工程、组织进化与垂直应用,深聊AI如何落地生产、创造价值。

主办方为“IT民工闲话”的读者们提供了赠票福利,注意还是要交保证金的。

请在本文下面留下评论,说说你遇到的AI最离谱的时刻或者讲讲你是怎么用好AI的,要求不少于50个字,好的内容有机会获得赠票福利!

相关学习资料