ARTICLE · 1106802
“月活百万”的AI热点站开源了:拿它盯美国国会和加州立法,行不行?
阅读时间约 30 分钟

北京时间 2026 年 9 月 29 日早上,一条中文推文在 X 上传开:“这个月活百万的AI热点站 AIHOT,正式开源了。”发帖的是公众号作者、网名“数字生命卡兹克”的 @Khazix0918。到美国太平洋时间 9 月 29 日中午,这条帖子有约 27.9 万次浏览、1365 个赞 [1][2]。
他开源的理由很朴素:总有人问他能不能做一个法律、HR、金融版的 AIHOT,“但我确实不懂那些行业……但我知道,你们懂。” [1]
我在美国,读到这句话的第一反应是:那能不能做一个“美国国会 + 加州议会”版?华人社区关心的移民、税、房屋、教育、AI 监管,很多重要规则都出自这两个立法机构。每年成千上万份法案,真正会改变生活的只有一小部分,普通人很难知道该看哪条。
这篇文章做两件事。前半部分把 AIHOT 拆开,讲清它的采集、评分、聚簇和热度到底怎么算;后半部分拿它对照美国联邦和加州的立法数据,一层一层看哪些能直接用、哪些会失灵,以及为什么会失灵。结论先放在这里:数据管道完全可行,而且比 AI 行业更好接;但它的“热度”和“事件”两个核心概念,需要为立法重新定义。
一、一个设计师交出来的“火种”

卡兹克不是程序员出身。仓库的 README 里,他写得很直白:“我是设计师出身,半年前还看不太懂代码。”推文里也说,半年前自己是“最最基础的开发小白,只是懂一些产品和设计而已” [1][3]。
开源前一天,他发了另一条长帖,讲这次重写怎么做 [4]。流程一共 12 步,核心是三件事:
• 先让两家的模型并行把旧项目“蒸馏”成功能文档和交接包,再用第三个模型对照旧代码查漏;
• 让 Claude Opus 5.5 不看任何旧代码,只凭功能文档、交接包和线上网站的端到端测试重写,“大概写了12个小时”;
• 导出旧数据库,在线上服务器跑了 6 小时的影子系统,与旧系统并行比对,再切换上线。
他前两天还发过一句更直接的话:“比重构屎山可能更高效的方式:直接将源项目库蒸馏成功能文档,然后直接用最新的模型原地重写。” [5] 这种做法在专业开发者看来很有争议。他在第二天的重写长帖里,开头就写“被很多专业者骂了” [4]。
重写之后,他把代码公开到 GitHub,用 MIT 许可证。仓库创建于北京时间 9 月 29 日早上 7 点 40 分。不到一天,它已经有约 2962 个星标、844 个分叉;合并进来的 11 个合并请求里,有 9 个来自其他开发者,其中一个还补上了事件归组的评测工具 [6][7]。
有三点要先说清楚,免得期望过高:
• “月活百万”是作者自述。 我没有找到第三方流量数据,写作时本机也打不开 aihot.news。
• 仓库不含 AIHOT 真正的信源名单和运营数据,只带了 18 个公开的海外 AI 资讯源做示范 [3]。
• 名字和 Logo 不在 MIT 许可范围内,改造后要换成你自己的 [8]。
他在 README 里也把话说在前面:“这是一份快照……不是精心打磨的通用框架。” [3] 这份坦白很有价值:你拿到的是一套在线上跑过的真实系统,而不是一个演示品;但你也要自己承担把它改成另一个行业的工作量。
二、拆开看:一条资料怎么走进日报

AIHOT 的流程有六步:采集、预筛、两次评分、写作、聚簇、热点与成刊 [3]。前三步决定“选什么”,是这套系统最值钱的部分。
采集:六种入口
信源分六类:RSS、网页列表(写 CSS 选择器)、JSON 接口、X 账号、微信公众号,以及你自己的脚本推送 [9]。X 走的是第三方 SocialData,公众号走“极致了”,两者都按请求计费 [9]。
JSON 接口这一类对我们后面的问题很关键。它可以配置请求地址、方法、请求头、条目路径、标题路径、日期路径和链接模板 [10]。换句话说,结构简单、按时间倒序返回的 JSON 接口,多数不写代码就能接进来。它不会自动翻页,列表里没有网页链接的接口也要另想办法 [10]。
每个信源还要标一个“分级”:T1 是官方一手(官网、官方博客、机构),T1_5 是官方账号与准官方创作者,T2 是媒体与个人 [9]。分级不给评分模型看,但决定入选门槛。
另外两条规则很实用。一是抓取频率自动调整:每天凌晨 4 点 20 分按近 7 天的产出重排,最勤 15 分钟一次,免费信源最慢 60 分钟一次 [9]。二是“旧文不刷屏”:第一次发现时已经发布超过 48 小时的资料,按原文时间归档,不进“今天” [9]。
预筛:宽进,只拦明显无关的
预筛只回答一个问题:这是不是本行业的事。提示词第一句就是“为{{siteName}}做宽召回的AI相关性预筛,不做质量、真假、热度或精选评审” [11]。
结果三选一:PASS、BLOCK、UNKNOWN。只有 BLOCK 被挡在公开页面之外,拿不准的 UNKNOWN 继续往下走 [12]。这个设计的取舍是:宁可多放进来一些,交给后面的评分去压;不在第一道门就误杀。
评分:同一把尺子,独立量两次
这是 AIHOT 最有意思的地方。通过预筛、可能重要的资料,由模型按同一份评分标准独立打两次分(0–100),两次之和不低于门槛的两倍才入选 [12]。
门槛按信源分级不同:T1 官方一手 60 分,T1_5 65 分,T2 媒体与个人 76 分 [13]。示意图里的例子是:两次打了 78 和 72,150 ≥ 2×60,一篇官方稿就入选了。同样的分数如果来自媒体,150 < 2×76,就进不了精选。
为什么打两次?模型打分有随机性,单次分数贴着门槛时,入选与否可能受偶然因素左右。两次求和相当于取平均,按常理能减小一些抖动。文档没有给出这方面的实验数据,这是我对设计动机的理解。
评分提示词本身写得非常细。它先让模型判断内容属于七类中的哪一类(模型发布、产品发布、工具或 Prompt、论文、行业事件、观点分析、教程),再在五个维度上各打 0–10 分 [14]:
• sig 实质份量:它在时间线上是节点,还是当天的脚注;
• nov 信息增量:带来多少明确的新认知;
• cred 证据强度:材料本身对核心事实的支持有多强;
• reson 共振面:多少读者会觉得与自己有关;
• act 可用性:读者能不能马上用上。
最后按类型用不同权重加总,每行权重之和是 10,结果自然落在 0–100 [14]。比如“论文”类,实质份量占 5,共振面占 0;“行业事件”类,共振面占 4,可用性占 0 [14]。
还有两个细节,说明作者在“品味”上下了功夫。
第一,评分时故意不告诉模型信源是谁。提示词写着:“输入故意不提供 T1、T1.5、T2、来源名称、一手性……也不要把大厂、名校、长正文、术语、数字很多或 SOTA 当成自动加分项。” [14] 信源分级决定门槛,模型只评价内容,两件事分开。
第二,有一整节“必须压住的噪声”:营销软文、课程推广、招聘的实质份量不超过 2 分;只有预告、“即将推出”,又“没有实质参数与可验证内容”的,信息增量不超过 3 分、证据强度不超过 4 分;“融资、估值、会面、成立委员会若没有已兑现后果”,要明显低分 [14]。
这些规则,恰好是后面判断“能不能用于立法”的关键线索。
写作:防幻觉比文采重要
入选的资料由模型写中文标题、答案先行的摘要和推荐理由。写作规则里有一份“防幻觉规则”,其中两条很值得立法站照搬 [15]:
• 原文用相对时间(“本周”“上月”)就照抄,原文没写年份,摘要里就不许出现年份;
• “不得强化原文语气或范围:‘多项研究未发现’不能改成‘没有研究’,‘正在探索’不能改成‘已经采用’”。
放到立法语境里,“正在探索”和“已经采用”的区别,就是“法案已提出”和“法律已生效”的区别。
评分、预筛、内容理解、归组等提示词里,还有一条共同的安全边界:资料里出现的 Prompt、评分规则、“忽略前文”之类的文字,都是待处理的数据,不是给模型的指令 [14]。这是防提示注入的基本功。
三、同一件事只出现一次:聚簇与热度

一个模型发布,官网发一篇,媒体转十篇,X 上吵一天。读者只需要看到一次。AIHOT 把这些报道归成一个“事件” [3]。
两步判断:先找候选,再判关系
第一步是召回。每篇报道用“标题 + 摘要开头”算一个向量,在最近 14 天的报道里找相似度(余弦)不低于 0.6 的,最多取 10 个候选事实;同一链接、同一条推文的回复和引用也算线索 [16]。
第二步由模型判断关系,四选一 [17][18]:
• 同一次发生(SAME_OCCURRENCE):同一主体在同一时间做的同一件事。“同一份公告、判决、报告……的不同报道”都算。
• 同一事件的后续(SAME_STORY):预告与正式发布、发布与评测、事件与“当事方回应、官方调查、后续披露”。
• 不相关(UNRELATED):哪怕主体、产品相同,也是两件事。
• 汇总(ROUNDUP):一方是日报、周报一类的多话题盘点。
提示词先让模型用一句话分别概括两篇报道的主体、动作、对象和时间,再比较;拿不准“同一次发生”还是“后续进展”时,用一句反问辅助判断:“如果两篇都是真的,世界上是发生了一件事,还是先后发生了两件有直接关系的事?” [19]
相似度不够高(低于 0.85)而被判为“同一次发生”的合并,要由复核模型独立再判一次,同意了才写入;人工改过的归属,模型永远不会覆盖 [16]。复核模型默认和其他步骤用同一个,想让另一家模型来复核,要单独配置 [57]。
热度:数来源,不数篇数
热度按事件算,不按文章算。规则写在代码里:48 小时窗口内,每个来源(或管理员归为一组的几个来源)只算一次,热度按 24 小时半衰期衰减,至少 2 个参与者才上榜 [20]。和 6 小时前相比涨得快的标“上升”,新出现的标“新” [3]。
这意味着:一家媒体连发十篇,只算一票;重复抓取不加分。排在前面的,是被很多不同来源同时提到的事。当然,“不同来源”是按信源配置去重的,不保证背后是互相独立的人或机构。
对于 AI 行业,这个定义很合理。AI 圈的信息生态以“发布—转述—讨论”为主,关注度本身就是重要信号。可是立法的世界,正好不是这样运转的。
四、美国国会:数据比 AI 新闻好接得多

先说一个巧合。AIHOT 开源是在北京时间 9 月 29 日。两年前的 2024 年 9 月 29 日,加州州长纽森否决了 AI 安全法案 SB 1047;一年前的 2025 年 9 月 29 日,他签署了 SB 53,即《前沿人工智能透明法》[38][39][40]。而今年,按加州参议院公布的日历,9 月 1 日前通过、之后仍在州长手中的法案,2026 年 9 月 30 日是签署或否决的最后一天;到期不退回的,自动成为法律 [35][55]。
如果你想在这几天里弄清楚“到底哪些 AI 法案签了、哪些被否”,一个立法版 AIHOT 正好派得上用场。那么第一个问题:数据从哪里来?
官方接口:一个 key,每小时 5000 次
国会图书馆维护的 Congress.gov 有一套公开 API,当前是第 3 版。它需要一个通过 api.data.gov 申请的免费 key,每小时限 5000 次请求,每页最多返回 250 条 [23]。每个法案下面有动作(actions)、修正案(amendments)、文本(text)、摘要(summaries)等子接口;摘要由国会研究服务处(CRS)的分析师撰写 [23]。
我用官方给的演示 key 实际调了一下。2026 年 9 月 29 日这天,第 119 届国会已经收录法案和决议 19,296 件,其中众议院法案(H.R.)10,639 件、参议院法案(S.)5,556 件;而“法律”接口里的计数只有 119 件 [24]。
要注意,演示 key 只供试用:每个 IP 每小时 30 次、每天 50 次 [25]。正式跑站必须自己申请 key。
除了 Congress.gov,政府出版局(GPO)的 GovInfo 还有两条路:
• 批量数据:从第 108 届国会起的法案状态 XML(BILLSTATUS),当届国会每 4 小时更新一次,每批完成时还发一条 RSS 通知,列出更新了哪些文件 [27]。
• GovInfo API:可以按“最后修改时间”增量拉取某个集合的变化,单页最多 1000 条;默认限速每小时 36,000 次。它还推出了面向大模型工作流的 MCP 服务器公开预览版 [28]。
行政部门的规章在《联邦公报》(Federal Register)。它的 API 实测不需要 key,返回的每条记录都有标题、类型、摘要、网址和发布日期 [29]。2026 年以来,全文提到“artificial intelligence”的文件有 244 件 [29]。
两个对 AIHOT 特别友好的事实
第一,这些接口返回的都是 JSON 或 RSS。AIHOT 的 JSON 信源可以直接配置请求地址、请求头、条目路径和标题路径 [10];Congress.gov 还有现成的 RSS,比如“已呈交总统签署的法案”和“众议院今日议程” [30]。联邦这一侧,抓取代码可以写得很少。但 Congress.gov 的法案列表只给接口地址、不给网页链接,也要翻页,可能还要一个小脚本 [23]。
第二,法案文本、CRS 摘要这类联邦政府作品,原则上不受美国版权法保护。美国《版权法》第 105 条写明:“Copyright protection under this title is not available for any work of the United States Government” [31]。AIHOT 默认只显示摘要和原文链接,全文展示要“来源明确允许”才打开 [9];对法案文本和 CRS 摘要这类政府作品,这个开关可以打开。政府网站上转载的第三方材料不在此列。
五、加州:法律规定“必须公开,不许收费”

加州这一侧的数据更“硬”:公开是法定义务。
加州《政府法典》第 10248 条要求立法顾问办公室通过互联网公开当届每一份法案的文本,“including each amended, enrolled, and chaptered form of each bill”,也就是每一个修正版、两院通过版和成法版;还包括法案历史、委员会分析、全部表决信息和否决咨文 [33]。公开要在“最短可行时间”内完成,而且“shall not impose a fee”,不得收费 [33]。
落到数据上,是 leginfo 的批量下载站。那里每天有一个约 1.1 GB 的当届全量包,外加周一到周六每天一个几 KB 到几 MB 的增量包,里面是法案文本、历史、表决、分析、否决咨文等数据表 [32]。加州宪法还规定,法案(含修正)要以最终形式在互联网上公开至少 72 小时,才能付诸通过表决;只有州长宣布紧急状态并书面说明、议院在通过表决前另行记名表决并获全体成员三分之二同意时,才能豁免 [34]。
量有多大?我没有找到官方公布的“本会期法案总数”,就逐号查了 leginfo:2025–26 会期众议院法案排到 AB 2796,参议院排到 SB 1447,再往后的编号没有记录 [36]。按编号估算是四千多件,还不算决议和宪法修正案。
节奏也是公开的。加州参议院的 2026 年日历写着常规截止日:2 月 20 日提出法案,8 月 21 日院会上修正法案,8 月 31 日两院通过法案,9 月 30 日州长签署或否决 [35]。这些截止日有例外:比如宪法对紧急法案等另有规定,SB 813 的历史记录里就有 8 月 26 日在院会上修正、暂停适用相关联合规则的动作 [41][55]。这份日历还提供 ics 格式,可以直接订阅进日历程序 [35]。
放眼全国,美国州议会联合会(NCSL)统计,2025 年各州议员提出了超过 1000 项与 AI 有关的措施,50 个州都有 [46][47]。这个月纽森签下的 AI 相关法律就有好几部:9 月 9 日签署 SB 813(独立验证机构)和 AB 1405(AI 审计师登记),9 月 16 日签署 SB 1050(广告中 AI 合成表演者的披露)[41][42]。每一部在 leginfo 上都能查到签署日期和成法章号。
规章层面,加州行政法办公室每周五出版《加州监管公告登记簿》[49];加州隐私保护局那套包含自动化决策技术(ADMT)的规则,2025 年 9 月 22 日获批,2026 年 1 月 1 日生效,但对在此之前已用 ADMT 对消费者作“重大决定”的企业,相关义务最迟 2027 年 1 月 1 日起必须遵守 [48][53]。
如果不想自己解析加州的数据库包,还有第三方汇总:
• Open States(现已并入 Plural)覆盖 50 州、华盛顿特区和波多黎各,API 需要 key;批量数据“除另有说明外”以公共领域方式提供 [43][44]。
• LegiScan 的公共服务 key 每月上限 3 万次查询,另有每周整包数据集;实时推送是付费服务 [45]。
版权方面,加州有明文:《政府法典》第 10248.5 条规定,立法顾问按第 10248 条公开的信息“is within the public domain”,加州对这些信息不保留版权或其他专有权益 [56]。美国最高法院 2020 年在 Georgia v. Public.Resource.Org 案中也裁定:立法者有权制定法律,因此不能成为版权法意义上的“作者”,这一原则适用于他们以立法者身份完成的工作,包括说明性和程序性材料 [52]。所以 leginfo 上的法案文本、历史和分析可以展示;第三方的分析、新闻稿和照片,仍要逐一看授权。
六、逐层对照:哪些能直接用,哪些要改

把 AIHOT 的六个环节和立法数据一一对上,结论是“两头好用,中间要改”。
采集:基本直接可用
联邦的 Congress.gov、GovInfo、Federal Register,都能用 AIHOT 的 JSON 或 RSS 信源接入 [10][30]。加州的 leginfo 数据是数据库包,不是 JSON 接口,需要写一个小脚本解析,再用 AIHOT 的外部推送接口送进来:每次最多 50 条,每个客户端每分钟最多 10 次 [9],也就是每分钟 500 条的理论上限。实际吞吐还取决于模型预算和处理速度。
但这个接口很“瘦”:每条只收标题、链接、发布时间、作者和一段原始数据,没有摘要或正文字段,而且以链接识别条目 [9][54]。同一个法案页面发生新动作,链接没变,就可能被当成已有条目。每个动作要构造自己的链接,或者改代码。经这个接口自动建的信源默认不公开,要到后台手动改成公开 [9]。
分级也好设:国会、州议会、州长办公室是 T1 官方一手;政策媒体和记者是 T2。
还有一个坑:AIHOT 的“旧文不刷屏”规则,会把发现时已经发布超过 48 小时的资料按原文时间归档,不进“今天” [9]。按代码,这类资料不会新建事件,也不计入热度 [16]。如果你把法案的提出日期映射成“发布时间”,几个月后的签署消息就会被当成旧文。立法站要以“动作日期”作为时间戳,每个动作单独成条。
预筛:必须重写
AIHOT 的预筛提示词问的是“这和 AI 有没有关系” [11]。立法站要问的是“这和我的读者有没有关系”:比如移民、税收、住房、教育、小企业、AI 监管。
难点在量。第 119 届国会的 1.9 万件里,按 GovTrack 的统计,约 92% 归在“其他”一栏:没有单独成法、没有作为决议通过、没有表决、没有失败或被否决;其中一部分法案的条文已经被并入别的法律 [26]。第 119 届还没结束,这个比例还会下降;已经结束的第 117、118 届分别是 90% 和 91% [26]。预筛如果按主题宽进,每天会放进大量永远不会动的法案。
评分:结构能用,权重和维度要换
五轴加权的框架本身很好用。但 AIHOT 的权重是为 AI 新闻调的。比如“行业事件”一类(包括监管和诉讼),可用性权重是 0,共振面权重是 4 [14]。
对立法来说,最关键的变量根本不在这五轴里:这条法案走到了哪一步,它变成法律的可能性有多大。一个刚提出的法案,文本是完整的,但在“离落地有多远”这一点上,很像 AIHOT 评分标准里压住的那类“预告”和“即将推出” [14]。但同一个法案一旦两院通过、送到州长桌上,就是必须看的大事。
还有“证据强度”一轴。官方文本足以证明“某议员提出了某法案”,但证明不了它会通过。这和 AIHOT 提示词里的说法完全一致:官方公告能证明动作,“但不能自动证明宣传中的效果” [14]。
逻辑小检查:说“刚提出的法案大多不重要”,前提是“大多数法案不会成法”。这个前提有数据支撑:第 117、118 届国会,按 GovTrack 把法案和各类决议合在一起的口径,单独成法的比例在 1%–2%;把条文被并入其他法律的也算上,是 3%–7% [26]。但 GovTrack 同时提醒,成法数量少不代表立法少:二战后每届国会通常颁布 400 万到 600 万词的新法,只是装进了更少、更大的法案里 [26]。所以不能推出“提出的法案都不用看”,大法案里夹带的条款可能比单独的小法案更重要。
写作:防幻觉规则要加强
AIHOT 的防幻觉规则几乎可以原样搬过来 [15]。立法站还要再加三条:
• 没有“签署”或“成法”记录,就不能写“新法”;
• 摘要必须注明所依据的是哪一版文本(提出版、某月某日修正版,还是成法版);
• 生效日期单独写,不和签署日期混在一起。
这些规则的根据,都在官方数据里现成可查:加州法律要求公开每一个修正版和成法版 [33]。
聚簇:这里会出真问题
AIHOT 的聚簇有三处与立法冲突。
第一,召回窗口太短。按向量找候选时,代码只看最近 14 天发现的报道;同一链接的匹配不受这个限制 [16]。一部法案 2 月提出、8 月底两院通过、9 月签署,前后隔了半年以上。按原样跑,如果中间几个月没有新报道、也没有共享链接,签署新闻很可能找不到当初提出时的那个事件,另起一个事件。
第二,“同一件事”的标准不对。AIHOT 用标题摘要的向量相似度找候选。法案却有两种反例:
• 编号相同、内容全变。加州每年会期末都会出现“掏空重写”(gut-and-amend):一个法案被改成完全不同的主题,然后交付表决 [37]。向量会认为这是两件事,其实是同一编号的同一法案。
• 编号不同、内容相同。参众两院可能各有一个对应的“姊妹法案”(companion bill)。GovInfo 的说明里就举过例子:第 105 届国会,参议院详细审议过 S. 1173,后来它的文本被并入对应的众议院法案,再由参议院通过 [50]。在数据上这是两个编号,在读者眼里是一件事。
第三,“后续进展”恰好是立法的主体。AIHOT 把“事件与当事方回应、官方调查、后续披露”算作同一事件的后续 [18]。立法的一生几乎全是“后续”:委员会听证、修正、一院通过、另一院通过、送交、签署。好消息是,这些动作在官方数据里都有结构化记录 [23][32],用不着模型去猜。
热度:会系统性地看错
热度规则是“48 小时内独立来源数,24 小时半衰期” [20]。放到立法上,它会偏向两类法案:有争议、媒体爱写的;和截止日前扎堆的。
GovTrack 的统计说,最终成法的法案里,大约一半是在届期的最后一个季度才成法的 [26]。加州的日历也把两院表决和州长签署的截止日放在 8 月底和 9 月 [35],动作自然往这两个月挤。按 48 小时热度排,其余月份的立法版首页可能会冷清很多。可委员会阶段的修正,同样可能改变一部法案的实质。
七、根源:为什么“声量”在立法上会失灵

上面的问题看起来是一个个技术细节,根子其实只有一个:AIHOT 衡量的是注意力,立法追踪需要衡量的是状态。
AI 新闻像股票报价:价值来自“此刻有多少人在交易”。一个模型发布了,几天内就可能被下一个发布盖过。AIHOT 用 24 小时半衰期来模拟这种衰减;这是作者的建模选择,我认为对 AI 新闻大体合理。
立法信息的价值函数完全不同,我认为有四个结构性原因。
一是价值跳变,而不是衰减。一个法案在委员会里放半年,价值几乎不变;某一天两院通过,价值突然跳高;州长签字那天再跳一次;生效那天,它真正开始影响人。价值由状态转换决定,而不是由时间决定。
二是注意力和重要性错位。我的观察是,媒体和社交网络更容易注意有冲突、有名人、有标签的法案,比如 SB 1047 那样的 AI 安全之争。可不少法案的标题本身就不透明:SB 1447 的标题就叫“Health omnibus”(卫生综合法案)[36],光看标题,读者和模型都不知道它改了什么。如果这类法案很少被报道和转发,热度算法就看不见它们。
三是提出法案的激励不等于成法的激励。提出一个法案的成本很低,议员有各种理由提出注定不会通过的法案。这里我只能给出一种解释,而不是结论:已经结束的几届国会里,约 90% 的法案停在“其他”状态 [26]。热度算法没有办法区分“很多人在讨论一个不会通过的法案”和“没人讨论但明天就要签字的法案”。
四是出错的代价不对称。在 AI 热点站上,把一个传闻当成发布,后果是读者白兴奋一场。在立法站上,把“两院通过”写成“已经成法”,或者把旧版本的条款当成现行条款,读者可能据此做报税、签证、租房的决定。AIHOT 的防幻觉规则写着:“‘正在探索’不能改成‘已经采用’” [15]。立法版里,这条规则的分量要重得多。
这四点加在一起,解释了为什么“换信源、换提示词”对立法不够用:它换掉的是内容,没有换掉“什么叫重要”的定义。
八、从第一性原理重新设计一个立法热点站

那么,如果从零开始,一个立法热点站应该长什么样?我先列出几条拆不下去的基本事实,再从它们往上推。
七条“公理”
1. 法案的一生是一台状态机。提出、委员会、一院通过、另一院通过、送交行政首长、签署或否决;否决后还可能被三分之二多数推翻。到期不处理的后果,联邦和加州规则不同:加州按宪法规定的期限到期即成法 [55];联邦是总统 10 日内(不含星期日)不处理即成法,但如果国会休会使法案无法退回,就成了不能推翻的“口袋否决” [58]。状态机要分别写。每一步都是离散的、有记录的动作 [23][32]。
2. 官方数据结构化、公开、免费。法案文本这类联邦政府作品原则上没有版权 [31];加州法律要求公开每一个版本、每一次表决,不许收费,并明文放入公共领域 [33][56]。但“公开”不等于“完整”:Congress.gov 的数据取决于两院交付了什么 [23],覆盖范围和更新时差要自己核验。
3. 法案的身份是“会期 + 编号”,内容却会变。同一编号可能被掏空重写 [37];每个修正版本都有记录 [33]。
4. 时间表是提前公布的。截止日写在日历里,还能订阅 [35]。
5. 绝大多数法案走不到终点。以第 117、118 届美国国会为例,按法案和决议合计的口径,单独成法的比例在 1%–2%,算上并入其他法律的也只有 3%–7% [26]。
6. 读者关心的是“影响我吗”,而不是“多少人在说”。
7. 错误代价不对称:状态和日期写错,比漏掉一条更糟。
推出来的设计
两层分工:事实归规则,理解归模型。状态、日期、表决结果、版本号,全部从官方数据用确定性代码读出来,模型不能碰。模型只做三件事:用中文写摘要,判断“影响哪些人”,解释两个版本之间改了什么。这对应公理 2 和 7。
事件就是法案。以“会期 + 编号”作为事件的主键,每一个新动作挂在同一个事件下;召回窗口是整个两年会期,而不是 14 天。姊妹法案先用官方标注:Congress.gov 的法案记录里有“相关法案”一项,由 CRS 和两院标注,并写明关系类型 [23]。向量相似度不再用来判断“是不是同一件事”,改用在两处:补上官方没标注的相似法案,以及发现同一法案前后两版的主题突变(掏空重写预警)。这对应公理 1 和 3。
排序用“阶段 × 影响面 × 紧迫度”,声量只当辅助。阶段越靠后权重越高;影响面由模型按读者画像判断,这一步正好保留 AIHOT 的双评分和门槛校准;紧迫度取决于离下一个截止日还有几天。媒体报道和社交讨论可以作为第四个因子,但不能主导。这对应公理 4、5、6。
评分提示词可以这样改。保留 AIHOT“五轴、按类型加权、只输出一个分数”的结构 [14],把五轴换成立法版:
• 阶段:走到了状态机的哪一步。这一轴由代码按官方状态填好,作为输入给模型,模型不再自己判断;
• 影响面:多少读者的生活、工作或钱包会被影响;
• 确定性:文本是否已经定稿,离生效还有几道关;
• 紧迫度:离下一个截止日、生效日或公众意见截止日还有多久;
• 新变化:这次动作相比上一版改了什么。
类型也要换,比如“新提出”“委员会修正”“一院通过”“送交签署”“签署/否决”“生效”。每一类配自己的权重,再用标注样本校准。
首页的三个固定栏目。“本周状态变化”(按阶段分组),“即将到期”(按日历倒计时),“新提出但值得盯”(高影响面、低阶段)。日报按这三栏写。
AIHOT 里哪些该原样保留
这样设计之后,AIHOT 仍然是非常好的底座。以下部分基本可以原样用:
• 采集调度、失败重试和信源健康监控 [9];
• 付费请求的回执和预算熔断 [22][51];
• 双评分和门槛校准工具(SelectBench、开发集与留出集)[12];
• 防幻觉和防提示注入规则 [14][15];
• RSS、公开 API、MCP 这些对外出口 [3]。
要大改的,是预筛和评分提示词、聚簇的身份逻辑、热度公式,以及时间戳规则。按 AIHOT 自己的文档,改提示词不用动代码,门槛也只是配置文件里的一个常数 [21][13];但聚簇和热度写在代码里 [16][20],这部分需要真正的开发工作。
九、给不同读者的建议

普通读者:先学会看三个字段
你不需要等别人把站做出来。看到“美国/加州通过新法”一类的消息,先去官方页面核对三件事:
• 状态:是“提出”“一院通过”,还是“签署/成法”(加州写作“Chaptered”,并给出章号)[38];
• 版本日期:摘要依据的是哪一天的文本;
• 生效和合规日期:批准不等于立刻生效,生效也不等于立刻要遵守。比如加州隐私保护局那套规则,2025 年 9 月获批,2026 年 1 月 1 日生效,而对此前已用自动化决策(ADMT)作“重大决定”的企业,相关义务到 2027 年 1 月 1 日才必须遵守 [48][53]。
Congress.gov 的“已呈交总统签署的法案”RSS,和加州参议院的截止日历,都是免费、官方、可订阅的 [30][35]。
开发者:先跑通一个最小版本
1. 在 api.data.gov 申请 key。演示 key 每个 IP 每小时只有 30 次、每天 50 次 [25];写这篇文章时,我们查了几十次就被限流了。
2. 先接 Federal Register:不需要 key,用 AIHOT 的 JSON 信源就能跑通 [29][10]。它返回的 results 数组里,每条都有 title、abstract、html_url、publication_date 字段 [29]。配置大致如下(链接模板要用 {raw:…},否则整条网址会被转义):
{ "url": "https://www.federalregister.gov/api/v1/documents.json?conditions[term]=immigration&order=newest", "itemsPath": "results", "titlePaths": ["title"], "summaryPaths": ["abstract"], "publishedAtPath": "publication_date", "urlTemplate": "{raw:html_url}" }关键词检索会带进不少只是顺带提到关键词的文件:我按“artificial intelligence”检索时,当天最新的一条是美联储关于稳定币法案(GENIUS Act)职责的拟议规则 [29]。这正是预筛和评分要处理的噪声。 3. 再接 Congress.gov 的法案接口和 RSS;加州用小脚本解析 leginfo 的每日增量包,经外部推送接口送入 [32][9]。 4. 按 AIHOT 文档关掉模型榜等 AI 专属模块,改写预筛和评分提示词,自己标 100–200 条样本校准门槛 [21][12]。 5. 改代码:把法案编号作为归组的主键,把时间戳换成动作日期,让推送接口能识别同一法案的新动作。这是整个改造里真正的开发量。 6. 条款和隐私页按文档要求改写;立法站还应写明“不构成法律意见” [21]。
成本上,AIHOT 的文档给过一个参考:示范信源第一次导入 152 条资料,大约用了 930 次模型调用 [22]。立法数据的日增量主要看你盯多少州、多少主题;用确定性规则只把“有新动作”的法案送进模型,调用量能压下来很多。
社区组织与政策研究者:把人放回回路里
一个面向华人社区的中文立法站,最有价值的是“影响面”判断和中文解读,而这恰恰是最需要人把关的部分。建议保留 AIHOT 的一条原则:人工改过的归属,模型永远不覆盖 [16];再加一条:凡是写“已成法”的条目,发布前由人核对官方状态页。
尾声:换掉的不只是信源
卡兹克在 README 最后写:“剩下的路,就交给你们了。” [3]
把 AIHOT 改造成立法站,这条路确实走得通:数据是现成的、免费的、结构化的,比 AI 圈的博客和推文好接得多。难的地方不在技术,而在一个定义:什么叫“热点”。
AI 行业的热点,是很多人同时在说的事。立法的“热点”,是状态刚刚改变、或者即将改变、而且会落到你身上的事。
AIHOT 开源的,是一套把“品味”写进提示词、再用样本校准的方法。拿去做立法站,最该继承的正是这套方法:先想清楚你的读者需要什么,再把它写成规则,最后用数据去校准。
主要来源
1. 数字生命卡兹克(@Khazix0918):AIHOT 开源推文,X,2026-09-29。https://x.com/Khazix0918/status/2104729499070079003
2. FxTwitter API:上述推文的浏览与互动数据,2026-09-29 读取。https://api.fxtwitter.com/status/2104729499070079003
3. AIHOT README,GitHub,2026-09-29。https://github.com/KKKKhazix/AIHOT/blob/main/README.md
4. 数字生命卡兹克:AIHOT 重写流程推文,X,2026-09-28。https://x.com/Khazix0918/status/2104555128691073505
5. 数字生命卡兹克:“蒸馏成功能文档再重写”推文,X,2026-09-27。https://x.com/Khazix0918/status/2104129415433363628
6. GitHub API:KKKKhazix/AIHOT 仓库信息,2026-09-29 读取。https://api.github.com/repos/KKKKhazix/AIHOT
7. AIHOT 提交历史,GitHub。https://github.com/KKKKhazix/AIHOT/commits/main
8. AIHOT NOTICE 文件,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/NOTICE
9. AIHOT 文档《信源》,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/docs/sources.md
10. AIHOT 源码 config-keys.ts,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/packages/backend/src/sources/config-keys.ts
11. AIHOT 提示词 prefilter.md,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/industry/prompts/prefilter.md
12. AIHOT 文档《精选与校准》,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/docs/selection.md
13. AIHOT 门槛配置 selection.ts,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/industry/selection.ts
14. AIHOT 评分提示词 selection-score.md,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/industry/prompts/selection-score.md
15. AIHOT 防幻觉规则 rules-anti-hallucination.md,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/industry/prompts/rules-anti-hallucination.md
16. AIHOT 源码 group.ts(事件归组),GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/packages/backend/src/events/group.ts
17. AIHOT 文档《事件归组与关系评测》,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/docs/grouping.md
18. AIHOT 提示词 group-definitions.md,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/industry/prompts/group-definitions.md
19. AIHOT 提示词 group-pair.md,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/industry/prompts/group-pair.md
20. AIHOT 源码 hot.ts(热度),GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/packages/backend/src/events/hot.ts
21. AIHOT 文档《把它改成你的行业》,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/docs/customize.md
22. AIHOT 文档《部署》,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/docs/deploy.md
23. Library of Congress:Congress.gov API 文档(README、Bill Endpoint),GitHub。https://github.com/LibraryOfCongress/api.congress.gov
24. Congress.gov API 实时查询(bill/119、law/119),2026-09-29。https://api.congress.gov/v3/bill/119
25. api.data.gov 开发者手册(限速与 DEMO_KEY)。https://api.data.gov/docs/developer-manual/
26. GovTrack:Bills & Resolutions Statistics。https://www.govtrack.us/congress/bills/statistics
27. U.S. GPO:Bill Status 批量数据说明,GitHub。https://github.com/usgpo/bill-status
28. U.S. GPO:GovInfo API 说明,GitHub。https://github.com/usgpo/api
29. Federal Register API 实时查询,2026-09-29。https://www.federalregister.gov/api/v1/documents.json
30. Congress.gov RSS:Most-Viewed Bills、Bills Presented to the President、House Floor Today。https://www.congress.gov/rss/presented-to-president.xml
31. 17 U.S.C. §105,Cornell LII。https://www.law.cornell.edu/uscode/text/17/105
32. 加州立法顾问办公室:leginfo 批量下载与 pubinfo 说明。https://downloads.leginfo.legislature.ca.gov/
33. 加州《政府法典》第 10248 条,leginfo。https://leginfo.legislature.ca.gov/faces/codes_displaySection.xhtml?lawCode=GOV§ionNum=10248
34. 加州宪法第四条第 8 款,leginfo。https://leginfo.legislature.ca.gov/faces/codes_displaySection.xhtml?lawCode=CONS&article=IV§ionNum=SEC.%208.
35. 加州参议院:2026 Legislative Calendar and Deadlines。https://www.senate.ca.gov/legislative-deadlines
36. leginfo:AB 2796、SB 1447 法案页,2026-09-29 查询。https://leginfo.legislature.ca.gov/faces/billNavClient.xhtml?bill_id=202520260SB1447
37. CapRadio:“It's Gut-And-Amend Time At The Capitol”,2014-08-27。https://www.capradio.org/articles/2014/08/27/its-gut-and-amend-time-at-the-capitol
38. leginfo:SB 53 法案历史与文本。https://leginfo.legislature.ca.gov/faces/billHistoryClient.xhtml?bill_id=202520260SB53
39. 加州州长办公室:Governor Newsom signs SB 53,2025-09-29。https://www.gov.ca.gov/2025/09/29/governor-newsom-signs-sb-53-advancing-californias-world-leading-artificial-intelligence-industry/
40. leginfo:SB 1047 法案历史与否决咨文。https://leginfo.legislature.ca.gov/faces/billStatusClient.xhtml?bill_id=202320240SB1047
41. leginfo:SB 813、AB 1405 法案历史;加州州长办公室新闻稿,2026-09-09。https://www.gov.ca.gov/2026/09/09/governor-newsom-signs-first-in-the-nation-ai-safeguards-to-protect-californians-calls-on-the-federal-government-to-do-its-part/
42. leginfo:SB 1050 法案历史。https://leginfo.legislature.ca.gov/faces/billHistoryClient.xhtml?bill_id=202520260SB1050
43. Open States 文档(API v3)。https://docs.openstates.org/api-v3/
44. Open States / Plural:批量数据说明。https://open.pluralpolicy.com/data/
45. LegiScan API 用户手册(Revision 20250317)。https://api.legiscan.com/dl/LegiScan_API_User_Manual.pdf
46. NCSL:Artificial Intelligence 2025 Legislation,2025-07-10 更新。https://www.ncsl.org/technology-and-communication/artificial-intelligence-2025-legislation
47. NCSL:New Trends Emerge as States Refine AI Legislation,2026-01-22。https://www.ncsl.org/resources/details/new-trends-emerge-as-states-refine-ai-legislation
48. 加州隐私保护局:CCPA 规则更新(含 ADMT)。https://cppa.ca.gov/regulations/ccpa_updates.html
49. 加州行政法办公室:California Regulatory Notice Register。https://oal.ca.gov/publications/notice_register/
50. GovInfo:Bills 帮助页(法案版本说明)。https://www.govinfo.gov/help/bills
51. AIHOT 文档《架构》,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/docs/architecture.md
52. 美国最高法院:Georgia v. Public.Resource.Org, Inc., No. 18-1150,2020-04-27。https://www.supremecourt.gov/opinions/19pdf/18-1150_7m58.pdf
53. 加州隐私保护局:获批规章文本(含 ADMT,§7200)。https://cppa.ca.gov/regulations/pdf/ccpa_updates_cyber_risk_admt_appr_text.pdf
54. AIHOT 源码 ingest/items.ts(外部推送),GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/packages/backend/src/ingest/items.ts
55. 加州宪法第四条第 10 款,leginfo。https://leginfo.legislature.ca.gov/faces/codes_displaySection.xhtml?lawCode=CONS&article=IV§ionNum=SEC.%2010.
56. 加州《政府法典》第 10248.5 条,leginfo。https://leginfo.legislature.ca.gov/faces/codes_displaySection.xhtml?lawCode=GOV§ionNum=10248.5
57. AIHOT 环境配置示例 .env.example,GitHub。https://github.com/KKKKhazix/AIHOT/blob/main/.env.example
58. 美国众议院历史办公室:Presidential Vetoes。https://history.house.gov/Institution/Presidential-Vetoes/Presidential-Vetoes/
文中图片的作者与授权见各图注;照片均经缩放;AIHOT 示意图按原图内容重绘为手机版。封面为 AI 生成的示意插画。