ARTICLE · 1117334
用海外 AI 越来越折腾,我开始认真考虑国产替代
最近,我开始认真考虑,把一部分日常工作转到国产 AI 上。

原因很直接。用一个 AI 工具,要是隔三差五就得研究限流、账号和模型状态,再强的能力也会被这些麻烦打折。
OpenAI 这边,额度变化、429 限流、503 服务不可用,以及社区里反复讨论的“降智”,让人越来越难安心把工作交过去。Anthropic 那边,中国用户对封号的担忧,又让另一种选择多了一层不确定性。
我自己遇到的问题,加上 Linux.do、X 上不断出现的反馈,让我开始重新考虑工具的选择。
与此同时,国产模型的能力也在提升。像 DeepSeek-V4.1-Flash,我目前的使用感受就不错,价格也有吸引力。
当替代方案开始够用,我就得重新算一笔账。继续折腾海外 AI,究竟还值不值?
付了钱,还要操心能不能正常用
过去挑 AI 工具,我主要看能力。
代码能不能写对,复杂问题能不能分析清楚,长任务能不能连续做下去。哪个效果好,就愿意为哪个付费。
现在,选择工具时多了不少顾虑。
OpenAI 的额度够不够撑完任务?回答质量不对劲,是上下文出了问题,还是模型被“降智”了?换到 Anthropic,又要考虑账号能不能长期稳定使用。
其中一些问题,我自己遇到了。另一些,则不断出现在我关注的 AI 社区里。
最近翻 Linux.do,看到两位用户分享的经历,就很能说明这种困扰。有人发现客户端的回答质量明显不如网页端,同一个账号,换个入口,体验就不一样了。
还有人怀疑问题出在登录环境,清理了陌生 IP 的登录会话后,感觉回答恢复了正常。但评论里并没有一致答案,有人认为问题还在,也有人建议退出所有设备,等一两天再试。
这些尝试有没有用,连讨论中的用户也拿不准。
大家原本是来用 AI 做事的,结果开始研究账号会话、登录环境和模型测试题。工具出了问题,用户还得自己猜原因、找办法。
这些排查时间,也应该算进使用成本。
OpenAI 的问题,是越来越难预期
我对 OpenAI 前一段时间的印象,是额度比较宽松。
有过各种额度重置,社区里也讨论过一些长期存在的“羊毛”空间。那时候,大家更关心怎么多跑任务,怎么把模型用得更充分。
随着编程能力和工具体验进步,OpenAI 越来越值得交付复杂工作。在我的感受里,一些任务上的表现,已经逐渐接近此前吸引我的 Claude Code 体验。
能力上来了,交给它的工作自然就多了。
让 AI 修改一个项目,背后可能需要反复读文件、改代码、运行测试。一句话发出去,实际会连续执行很多轮。更多人这样使用,算力需求就会随之增加。
根据这些使用变化,我推测,算力和成本压力是最近一系列收紧现象的重要原因。
用户首先感受到的,是任务被打断。
429 通常意味着触发了请求频率或配额限制,503 则表示服务暂时无法处理请求,可能涉及过载或其他故障。对正在赶进度的人来说,遇到这些报错,就得等待、重试,或者换工具。
还有额度降低带来的落差。买套餐时,用户会按照公布的额度安排工作。官方调整额度标准后,原来的预算和使用计划也得跟着重算。对照着原先预期购买套餐的用户,当然会重新考虑值不值。
至于“GPT-6 被路由到 Luna”,也是社区讨论中的一个焦点。路由指请求最终由哪个模型处理,仅凭回答质量或模型自报身份,还无法确认具体的路由情况。
这些反馈让我在意的是,付费之后,我仍然需要反复确认,自己现在得到的服务是否符合预期。
换一家,也有另一种担心
如果只是某一家服务不稳定,换一家就好了。
但对中国用户来说,选择海外 AI,经常还要考虑地区支持和账号风控。围绕 Anthropic 的封号反馈,就让人很难把“换到 Claude”当作一个毫无顾虑的答案。
换个平台,原来的问题未必还在,却可能多出新的顾虑。
具体到某次限制或者封号,原因可能不同,不能把所有个案都归为同一种政策。但这些经历累积起来,会实实在在地影响中国用户的选择。
工作对 AI 的依赖越深,中断的代价就越大。
偶尔聊几句,服务出问题可以晚点再来。正在处理一个项目,任务做到一半突然不能继续,就得重新安排工作。如果还要换平台,之前的背景、文件和进度,往往需要重新交代。
我愿意为工具学习使用方法,也能接受合理的额度限制。可如果账号和服务状态长期难以预期,我就不愿意把越来越多的工作依赖放上去。
国产模型进步,让这个选择开始有了余地
以前,即使觉得折腾,很多人还是会继续用海外模型。复杂任务对能力有要求,多处理一点麻烦,也可能值得。
现在,我开始觉得可以重新比较了。
DeepSeek-V4.1-Flash 给我的初步感受不错,也让我愿意继续研究它能接走哪些工作。目前还谈不上完整评测,复杂任务的表现,需要放到自己的工作里检验。
国产替代可以逐步做。
先挑一类自己经常处理、结果容易检查的任务,比如整理材料、修改文章,或者完成边界明确的代码改动。把同样的要求交给不同模型,看最终能不能做对,需要人工改多少,再比较实际花费。
例如让模型修改一个页面,验收就看指定功能是否实现、原有功能有没有被破坏。一次生成看起来漂亮,后面修了很多轮,这些返工都得算进去。
海外模型适用同样的标准。能力更强,如果能明显减少返工,贵一些也值得;如果日常任务用国产模型就能顺利完成,我没有必要继续为同样的结果承担更多折腾。
当模型能力逐渐接近我的实际需求,价格、访问便利和账号稳定性,就会更直接地影响选择。
我接下来准备把国产模型能做好的工作逐步迁过去,复杂任务继续按效果挑工具。
最近我也在研究怎么把 DeepSeek-V4.1-Flash 用到日常工作里,后面会继续分享使用过程和踩过的坑。如果你也想一起试试,可以关注后私信我,我拉你进 AI 学习交流群,一起交流。