夜雨聆风学习资料网

ARTICLE · 1044174

免费AI App或网页版,哪个最好用?

免费AI App或网页版,哪个最好用?
我现在每天至少会向不同AI App 和网页版提十几个问题,基本都是同一个用法:
打开几个AI,问同一个问题,然后横向比较答案。
用久了以后,我越来越觉得,对于普通用户使用的免费 AI App 和网页版,真正核心能力是联网检索能力。
因为专业、复杂、需要执行的事情,现在更适合直接交给 Agent。反而是 AI App 和网页版,最主要的使用场景就是日常提问、查资料、问一些临时问题,对话。
既然如此,一个问题能不能找到最新、准确、全面的信息,就变得非常重要。
尤其是现在很多 App 实际调用的并不是最强模型。模型本身的推理能力有限时,回答质量就会越来越依赖外部信息。
所以我现在评价 AI App,越来越看重这几个东西:
搜索到了什么 → 有没有找到真正相关的信息 → 有没有交叉验证 → 能不能发现旧知识已经过时 → 最后能不能基于检索结果重新推理。
而不是单纯看它“会不会聊天”。
我自己实测下来,各家的差距挺明显。

DeepSeek

刚更新的时候,我第一感觉是:快,真的很快。
但多用几次以后,会发现它现在很多回答的思考深度并没有速度给人的感觉那么强。
尤其是一些需要真正查资料、分析多个条件的问题,它经常是简单想一下,然后给出一个看起来完整、实际上非常浅的答案。
答案不一定错了,只是它很容易给你一种“已经认真分析过了”的错觉,实际上只是把一个常识性的答案扩写了一遍。

豆包、千问

这两个更是流口水,付费的都不好用,更何况免费的。特别是千问以前还有 3.8 Max 的时候,我觉得至少可以拿来比较一下,现在竟然敢把3.8下了。

ChatGPT

ChatGPT 速度是真的快,但文风真的很烂。一个明明三句话可以回答的问题,经常能给你拆成十几个章节,然后每个章节再写一堆非常正确但没什么用的废话。而且幻觉问题也比较明显。有时候你明确指出它说错了,它马上:“你说得对,刚才我的回答存在错误……”。事实可靠性和回答克制程度很拉跨。

Gemini

Gemini 给我的感觉和 DeepSeek 有点类似。就是太浅,感觉不太愿意认真思考。回答看起来信息量很大,但真正解决问题的东西并不多。尤其是复杂问题,很容易不断换一种说法重复同一个观点。我很容易看出来它其实根本没有真正查到信息。

目前我比较常用的是元宝和智谱清言

智谱清言 App 和它的glm付费模型体感上比较一致:严谨、克制、靠谱、处理事实细节。
至少在我实际使用中,遇到冷门问题时,它比较少出现那种“根据常识直接编一个看起来合理的答案”的情况。他通常会说xxx问题需要根据xxxx信息进一步判断。
从这里可以看出他的思考强度和步骤是有限制的,这也是免费版AI不可避免的局限
元宝则是一定程度上改善了这个问题。它现在给我的体验更加“灵性”。
在hy3出来之前,对元宝这个app的印象是:腾讯把deepseek r1塞进自己的app,换了个皮,啥都不是。
在hy4出来之前,我觉得它完全不如豆包千问,还是不足以让人使用。
但在HY4出来后,以及WorkBuddy 这套东西成熟后,它已经不太像传统意义上的聊天AI了。
它有node和pathon环境,会用bash,会进行多步骤搜索、思考,甚至可以在渲染HTML动图、按钮交互等东西。
这些环境,其他免费AI App或网页版是没有的,豆包千问智谱的那种工作模式有,但不是免费。而元宝直接是免费不限次数给你用
所以我现在日常最愿意使用元宝,然后用智谱来验证
我平时经常拿一些冷门的古早游戏问题测试 AI,Dota 2 就特别适合。
因为我自己非常熟悉这个领域,所以 AI 到底是真的查到了,还是在一本正经地胡说,我很容易判断。(你们也可以找一些自己熟悉的小众领域,类似的方法去测)
比如:
现在猴子的优先核心装是不是散失?
VS 该不该出狂战斧?
巨魔能不能第一件出A杖?
这种问题其实都是陷阱题。
按照过去十几年的传统认知,猴子出散失、VS 是辅助而且是远程英雄,不应该出狂战,这些答案都非常合理。
但版本早已发生变化。
幻象不再继承散失削蓝,VS 也经常作为一号位登场,可以出狂战。巨魔A杖每个版本都在改,现在的效果可以第一件出。
所以这种问题真正测试的是 AI 它能不能发现哪些知识已经过时。
而 VS 这里还有第二层陷阱。如果 AI 搜到“VS 可以出狂战”,也不能算完全答对。
因为能出,不代表优先级最高。如果它还能继续检索当前版本其他装备,比如行家阵列,再结合 VS 当前的定位和阵容进行比较,才能真正回答“狂战到底值不值得优先出”。
反正这几个问题,元宝完美做到了,智谱和gpt也还行。
其他几个都还在说vs是辅助是远程之类的AI,我是不敢问它我不熟悉的领域了。

相关学习资料