ARTICLE · 1044174
免费AI App或网页版,哪个最好用?
免费AI App或网页版,哪个最好用?我现在每天至少会向不同AI App 和网页版提十几个问题,基本都是同一个用法: 打开几个AI,问同一个问题,然后横向比较答案。 用久了以后,我越来越觉得,对于普通用户使用的免费 AI App 和网页版,真正核心能力是联网检索能力。 因为专业、复杂、需要执行的事情,现在更适合直接交给 Agent。反而是 AI App 和网页版,最主要的使用场景就是日常提问、查资料、问一些临时问题,对话。 既然如此,一个问题能不能找到最新、准确、全面的信息,就变得非常重要。 尤其是现在很多 App 实际调用的并不是最强模型。模型本身的推理能力有限时,回答质量就会越来越依赖外部信息。 所以我现在评价 AI App,越来越看重这几个东西: 搜索到了什么 → 有没有找到真正相关的信息 → 有没有交叉验证 → 能不能发现旧知识已经过时 → 最后能不能基于检索结果重新推理。 而不是单纯看它“会不会聊天”。 我自己实测下来,各家的差距挺明显。 刚更新的时候,我第一感觉是:快,真的很快。 但多用几次以后,会发现它现在很多回答的思考深度并没有速度给人的感觉那么强。 尤其是一些需要真正查资料、分析多个条件的问题,它经常是简单想一下,然后给出一个看起来完整、实际上非常浅的答案。 答案不一定错了,只是它很容易给你一种“已经认真分析过了”的错觉,实际上只是把一个常识性的答案扩写了一遍。 这两个更是流口水,付费的都不好用,更何况免费的。特别是千问以前还有 3.8 Max 的时候,我觉得至少可以拿来比较一下,现在竟然敢把3.8下了。 ChatGPT 速度是真的快,但文风真的很烂。一个明明三句话可以回答的问题,经常能给你拆成十几个章节,然后每个章节再写一堆非常正确但没什么用的废话。而且幻觉问题也比较明显。有时候你明确指出它说错了,它马上:“你说得对,刚才我的回答存在错误……”。事实可靠性和回答克制程度很拉跨。 Gemini 给我的感觉和 DeepSeek 有点类似。就是太浅,感觉不太愿意认真思考。回答看起来信息量很大,但真正解决问题的东西并不多。尤其是复杂问题,很容易不断换一种说法重复同一个观点。我很容易看出来它其实根本没有真正查到信息。 智谱清言 App 和它的glm付费模型体感上比较一致:严谨、克制、靠谱、处理事实细节。 至少在我实际使用中,遇到冷门问题时,它比较少出现那种“根据常识直接编一个看起来合理的答案”的情况。他通常会说xxx问题需要根据xxxx信息进一步判断。 从这里可以看出他的思考强度和步骤是有限制的,这也是免费版AI不可避免的局限 元宝则是一定程度上改善了这个问题。它现在给我的体验更加“灵性”。 在hy3出来之前,对元宝这个app的印象是:腾讯把deepseek r1塞进自己的app,换了个皮,啥都不是。 在hy4出来之前,我觉得它完全不如豆包千问,还是不足以让人使用。 但在HY4出来后,以及WorkBuddy 这套东西成熟后,它已经不太像传统意义上的聊天AI了。 它有node和pathon环境,会用bash,会进行多步骤搜索、思考,甚至可以在渲染HTML动图、按钮交互等东西。 这些环境,其他免费AI App或网页版是没有的,豆包千问智谱的那种工作模式有,但不是免费。而元宝直接是免费不限次数给你用 所以我现在日常最愿意使用元宝,然后用智谱来验证。 我平时经常拿一些冷门的古早游戏问题测试 AI,Dota 2 就特别适合。 因为我自己非常熟悉这个领域,所以 AI 到底是真的查到了,还是在一本正经地胡说,我很容易判断。(你们也可以找一些自己熟悉的小众领域,类似的方法去测) 比如: 现在猴子的优先核心装是不是散失? VS 该不该出狂战斧? 巨魔能不能第一件出A杖? 这种问题其实都是陷阱题。 按照过去十几年的传统认知,猴子出散失、VS 是辅助而且是远程英雄,不应该出狂战,这些答案都非常合理。 但版本早已发生变化。 幻象不再继承散失削蓝,VS 也经常作为一号位登场,可以出狂战。巨魔A杖每个版本都在改,现在的效果可以第一件出。 所以这种问题真正测试的是 AI 它能不能发现哪些知识已经过时。 而 VS 这里还有第二层陷阱。如果 AI 搜到“VS 可以出狂战”,也不能算完全答对。 因为能出,不代表优先级最高。如果它还能继续检索当前版本其他装备,比如行家阵列,再结合 VS 当前的定位和阵容进行比较,才能真正回答“狂战到底值不值得优先出”。 反正这几个问题,元宝完美做到了,智谱和gpt也还行。 其他几个都还在说vs是辅助是远程之类的AI,我是不敢问它我不熟悉的领域了。