乐于分享
好东西不私藏

给 AI Agent 一键装上看 B 站、读小红书等上网能力的神器

给 AI Agent 一键装上看 B 站、读小红书等上网能力的神器
  • 📖 "去 Reddit 上看看有没有人遇到过同样的 bug" → 403 被封,服务器 IP 被拒
  • 📕 "帮我看看小红书上这个品的口碑" → 打不开,必须登录才能看
  • 📺 "B站上有个技术视频,帮我总结一下" → 拿不到,通用下载工具被 B站风控全面拦截

你想想看。一个 Agent 装在你电脑上,它能读写文件、能跑 shell、能查 GitHub、能编辑代码。但你让它去看个 B 站视频,刷个推特,读条小红书?不好意思,臣妾做不到。

为什么?

因为这件事比你想的要拧巴得多。

这块我想多聊两句,因为很多朋友可能不太了解这里面的水有多深。

你以为「让程序看一个网页」是个简单事?以前是。现在不是了。

每个平台都有自己的反爬机制。推特有自己的 rate limit 和风控,B 站有自己的签名算法和 IP 黑名单,小红书更狠,连接口都加密了好几层。

你随便抓一下,可能就给你来个 412 Precondition Failed,或者 403 Forbidden,或者更骚的,返回一堆假数据让你以为抓到了。

所以这两年为啥冒出来那么多 XX 平台爬虫工具,就是因为每家平台都在跟爬虫斗智斗勇,而且平台方基本都赢。

这就带来一个很尴尬的局面。

你想让 Agent 上网调研,结果它要么直接说我做不到,要么就开始编,编得还挺像。

回到 Claude Code 那次。我后来让它老老实实告诉我它能不能访问,它说不能。

但它当时没直接说不能这件事本身,就挺让我无语的。

= =

我不是说 Claude Code 不好。它是个好 Agent。但它作为一个通用 Agent,它没法预装全网所有平台的访问能力,这不现实。

这就需要一个中间层。一个专门负责「让 Agent 能上网」的基础设施。

我之前其实零零散散用过一些。比如用 RSS 接推特,用 yt-dlp 下视频然后让 Agent 读字幕,用各种野路子工具对付小红书。

但每用一个,我就得自己配一遍。

推特风控变了,我得改 RSS 配置。B 站接口改了,我得更新 yt-dlp。小红书更别提了,每隔两周我就在找新的工具替换旧的。

累,真的累。

直到前两天我刷到一个项目,叫 Agent-Reach。(链接放文末啦~)

我跟你说,这玩意的定位一下子就戳中我了。

它的描述很简单。给 AI Agent 一键装上刷推特、看 B 站、读小红书这些上网能力。

就一句话。

我当时心想,嚯,这口气不小啊。

然后我就装上试了试。

具体怎么装的我就不展开说了,免得变成操作教程。你只要知道一件事。

一条命令。Agent 自己把自己装好。

你没看错。你跟 Agent 说一声 reach install,它自己就去把推特、B 站、小红书这些渠道的能力装上了。装什么工具、怎么配置、怎么对接,Agent 自己去搞。

我当时就有点愣住。

因为我之前装这类东西,都是我自己手动配置。下载工具,配置环境变量,调试参数,遇到问题再 Google 半天。

现在你告诉我,Agent 能自己装自己?

这种感觉太爽了。

而且装完之后,我让 Claude Code 去读那个之前它「编」过的 B 站视频。它真的去把视频拉下来,把字幕提取出来,然后给我做了一个像模像样的总结。

我对照了一下视频原内容。

准的。

这次它没编。

那一刻我是真的觉得,这事儿有点东西。

顺着上面的再聊聊。

Agent-Reach 装好之后我研究了一下它的架构,发现更妙的地方。

它不只接一个工具,它接了多个。

推特走一套后端,B 站走另一套,小红书又一套。

这听起来好像没啥,但关键在于,它会自动路由。

啥意思?

假设你让它去读 B 站,正常情况下它用 yt-dlp 这个工具去抓。

但某一天 B 站升级了风控,yt-dlp 被封了,返回 412。

换别的工具,你得自己知道这事儿,自己去换工具,自己去改配置。

用 Agent-Reach 呢?

它自己会切到备用后端。你完全无感知。

这块我觉得是它最聪明的地方,也是最体现作者理念的地方。

把「平台的封禁」这件事,从用户的脑子里彻底拿走。

你不需要知道 yt-dlp 被封了,你也不需要知道有什么备用方案。你只需要跟 Agent 说「帮我看这个视频」,剩下的 Agent-Reach 帮你搞定。

说真的,这背后的产品哲学很打动我。

大多数工具的思路是,给你一堆选项让你自己挑。Agent-Reach 的思路是,你别管了,我都给你安排好了。

这两种思路的差别,就像你打车。

一种是给你一张城市地图,告诉你所有可能的路线,你自己选。

另一种是直接给你一辆车,告诉你上车就行。

后者对绝大多数人来说,体验好太多了。

然后我发现了它一个特别骚的功能。

doctor。

对,就是 doctor。体检。

你跑一下 reach doctor,它自己给你做一遍全身检查。每个渠道都过一遍,看哪个能用、哪个坏了、坏在哪。

但这还不是最骚的。

最骚的是,它不只告诉你哪儿坏了,它还给你开处方。

哦,你这个推特渠道返回 401 了,它说,可能是你的 token 过期了,建议你执行 XX 命令刷新。

哦,你这个 B 站渠道抓不到视频了,它说,可能是 yt-dlp 版本太老了,建议你执行 XX 命令升级。

你敢信???给处方???

我当时看到这个的时候,就觉得这个作者是真的懂用户。

因为这才是真实使用中最痛的点。

不是装不上,是装上之后哪天突然坏了,你不知道为啥,也不知道怎么修。

我之前用 yt-dlp 的时候就经常遇到。突然某一天它就抓不下来了,我去 Google 一搜,一堆人也在问同样的问题,答案五花八门,有的说升级,有的说换参数,有的说换个 IP。

累死。

现在你直接跑个 doctor,处方都开好了,照着做就行。

这种体验上的差别,坦率的讲,是巨大的。

然后我跟你讲个事。

这个项目的 README 里有个细节,不仔细看可能就错过了。

它说之前 B 站把 yt-dlp 风控封死了,412。

然后作者默默地换到了 bili-cli。

用户零感知。

就这六个字。

用户零感知。

我自己看到这的时候愣了好几秒。

你想想这背后有多少工作量。

yt-dlp 是个非常成熟的项目,全球无数人在用。B 站把它封了,意味着一个开源的、被广泛信赖的工具被针对了。

这种情况,一般的应对是发个 issue 等更新,或者用户自己去 fork 一个修修补补。

这个作者没等。

他直接换了一套后端,重新接上,重新测试,重新部署。

而用户呢?

什么都没感觉到。视频照样能看。

太特么赤鸡了。

我跟你讲,这种事在外面的开源项目里其实不算常见。

因为它不性感。

你写个新 feature,PR 合并了,star 蹭蹭涨,大家都在夸。

你默默换了个后端,用户甚至不知道发生了什么。没人会来给你点赞。

但恰恰是这种不性感的工作,决定了一个工具能不能真的在生产环境里活下去。

回到 Agent-Reach 这个项目本身。

我自己的感受是,它不是一个炫技的项目。

它没有发明什么新算法,没有跑什么惊艳的 benchmark,没有说自己在哪个 leaderboard 上排第几。

它做的事情很朴素。

把 Agent 真正能「上网」这件事,封装成了一个稳定的、不需要用户操心的能力。

你不用懂 yt-dlp 是啥,你不用懂 B 站的签名算法,你不用懂推特的 rate limit 怎么算。

你只需要跟你的 Agent 说,去看看这个视频讲了什么。

它就去了。

搞定了。

你说这有啥技术含量?

坦率的讲,单个拆开看,每一个组件都是现成的。yt-dlp 是别人写的,bili-cli 是别人写的,推特的 API 是推特提供的。

但把它们拼起来,做成一个「零感知」的产品,这件事本身,就是巨大的价值。

这块我想多说一句。

我们这两年聊 AI 的时候,注意力基本都在模型本身上。GPT 又升级了,Claude 又变强了,DeepSeek 又开源了。

但其实支撑这一切的,是大量的、不性感的、没有人会写 PR 夸的基础设施工作。

你模型再强,Agent 看不到 B 站视频,它就只能编。

你 Agent 再聪明,不知道怎么读推特,它就只能猜。

而让 Agent 真的能「看到」这个真实世界,靠的就是 Agent-Reach 这种东西。

把那些脏活累活都干了,把那些半夜被报警叫起来修 bug 的事都扛了,让用户能安安心心地说一句「帮我看看这个视频」。

怎么说呢。

这让我想起一个很老的话题。

一百多年前,爱迪生那一帮人折腾灯泡的时候,媒体都在报道灯泡有多亮。

但让灯泡真的能照亮千家万户的,是那些铺设电网、修建发电站、维护线路的工人。

他们不发光。

但没有他们,光就不存在。

Agent-Reach 就是电网。

不是最亮的那颗星,但没了它,整个屋子都是黑的。

顺着这个再聊聊别的。

我之前跟一个做 Agent 产品的朋友聊,他跟我抱怨说,现在用户对 Agent 的预期和 Agent 实际能交付的能力之间,有个巨大的鸿沟。

用户以为 Agent 是个超人,啥都能干。

实际上 Agent 是个刚学会走路的小孩,很多事它能做,但需要有人在旁边扶着。

Agent-Reach 干的事,就是给这个小孩装上眼睛、耳朵、腿。

让它能真的走到真实世界里去,而不是只活在你电脑的终端里。

我有时候觉得,2025 年 Agent 真正能不能落地,不是取决于模型有多强,而是取决于这种「接驳现实世界」的基础设施有多完善。

模型是发动机。

Agent-Reach 这种东西是传动轴、轮胎、方向盘。

你发动机再猛,没有传动轴,车也跑不起来。

这尼玛就是现实。

所以回到开头那个场景。

如果当时我装的是 Agent-Reach,Claude Code 就会自己去抓那个 B 站视频,自己提取内容,然后给我一个真实的总结。

它不会再编。

因为它能「看到」了。

说起来有点讽刺。

一个 AI Agent,想要不撒谎,第一步居然是...能真的上网。

我一直觉得,未来几年 AI 领域真正的主战场,可能不是更大的模型。

是这些不性感的、把模型和真实世界连起来的基础设施。

你模型再聪明,看不到这个世界,也是闭门造车。

能让 Agent 真的「走」出去的,才是真功夫。

Agent-Reach 这种项目,可能永远不会上 Hacker News 头条。

但我赌它会比很多明星项目活得更久。

因为它解决的是一个真实存在的、每天都在发生的问题。

而且它把这个问题解决得很安静。

你甚至不会意识到它的存在。

这可能是对一个工具最高的赞美。

我那天用 Agent-Reach 看完那个视频之后,对着终端发了一会儿呆。

就想起来以前没有 Agent 的时候,我自己吭哧吭哧地手动抓视频、提取字幕、整理笔记的下午。

现在只要一句话。

怎么说呢。

这种感觉太爽了。

https://github.com/Panniantong/Agent-Reach