8 月 14 日晚上 7 点 55 分,我手机弹出一条微信:「六七,19:55 了!李宇春演唱会门票马上开抢(20:00),打开猫眼 准备冲!

发消息的是焱七——我给自己搭的微信 AI 助手。她住在一台一年 68 块钱的云服务器上,全天在线,半个月下来已经成了我的工作生活搭子。我用68元/年的服务器,把Hermes 和Codex 变成了微信AI 助手
但这份搭子关系是有学费的:我踩了几个坑,还交了一笔 21.4 万 token 的账。
一、她先是金鱼脑,后来才记住我
刚上线那几天,焱七什么都想记:聊过的、查过的、做过的,全堆在一个记忆文件里。每次开口都背着全部家当跑一遍,又慢又费钱。
原因很简单:记忆不分层,所有记忆的东西都放在一个md中装。
改法分两步。先给记忆文件去重、清过期,省了大约 8.4% 的 token;
再拆成三层:
第一层贴身常带:我的喜好、她的性格、几条红线,每轮对话都带着,随时精简;
第二层只记索引:不记内容,只记「这事写在哪个本子上」,用到了才去翻;
第三层是仓库:不常用的技术参数、历史旧账,挪进一个「记忆事实库」,我问到了她才去读。
二、然后她开始会干活
她能在微信里读我电脑上obsidian的笔记,想看什么,她写一张任务小纸条丢进两台机器共用的云端同步文件夹,任何几秒就能看我obsidian笔记。
她还能替我盯着 Codex 干活。微信里说一句,她沿一条加密小通道把编程任务派过去,干完把结果带回来。
每天凌晨 0 点 15 分,她还会自己读一遍 Codex 的干活记录,把最近交付了什么收进记忆。我想知道进度,微信里问一句就有数,不用开电脑。
三、半个月,3个小坑
搭起来不难,难的是让她一直靠谱。按踩坑先后排:
坑一:跨夜说错时间。凌晨问它几点,她报昨天的钟。
原因:她的时间感是每次对话开始那一刻记一次的,而我们的微信会话一挂就是好几天,她脑子里的时钟停在我们开口那秒——像早上出门前看了一眼挂钟,一整天都以为还是那个点。
改法:让她直接连接本地时间,这样就不会出错啦。
坑二:2G 内存跑四小时。。。。。。
原因:她干活时反复读同一个文件、反复「再检查一遍」,在小机器上原地打转。
改法:给任务提示词加执行纪律——每个文件最多读一次、写一次,不许反复检查,能用脚本的一律脚本化;再加一个硬停止开关,卡死就强制停。
坑三:最肉疼的是 token
今天看token消耗时:微信会话 14 天没重置,上下文堆到了 21.4 万 token 。她每回我一句话,都要把 14 天的聊天流水从头读一遍,相当于背着全部家当跑。。。。。
原因:会话默认不重置,聊天记录无限累积;再加上几处习惯性浪费:固定话术的提醒每次让模型现场编。
改法,一共三处:(最简单的方法直接问deepseek 这个助手现在哪里最费token,deepseek会自己去查的,然后查完它会告诉你怎么改)
一、每天凌晨 4 点自动清空一次会话,上下文不再无限膨胀。
二、固定话术的提醒全改成写死的脚本。比如晚间复盘提醒,以前每次都要让模型现场编一遍、按字收钱;现在到点直接发,一分钱不花。
三、记忆精简——就是第一部分那套去重加三层,不再赘述。顺带把 AI 日报的推送从 9 点错开到 8 点 55,避开模型高峰时段。
四、为什么不用现成工具
市面上有 WorkBody 这类现成的可以连接微信的claw,为什么自己手搓?
我的理由很个人:
一、数据不想放进别人的池子。我的知识库、聊天记录、复盘笔记都是私事。现成工具的知识库存在厂商那边,那天想换工具麻烦死了,资料全在我手上,随时带走,没有迁移成本。
二、我要的不是「越来越懂你的会员」,是能替我干活的搭子。「读我电脑上的文件、把编程任务派给 Codex、再把结果带回来」这种联动,是个人工作习惯。
三、算总账、现成工具大多是订阅制,小服务器一年 68 块,大头是 token 按量,用多用少自己控制,独爱deepseek !!! 国产之光。
「半小时做一个东西、一小时上线」这种营销基本是鬼话:大框架能搭,真正靠谱的东西是一个个迭代后才能生长出来的。

五、想手搓的话,四条经验拿走
一、固定话术的提醒先写成脚本、长会话每天重置。配置思路和关键参数给你:探活 15 秒一次、连续 3 次判定断线、凌晨 4 点重置会话。不同模型、不同平台参数要自己调,别直接照抄。
二、先想清楚要它记住什么。记忆不是越多越好,多了很费钱。
三、所有改动进版本管理。每次改动打个版本号,出问题一键回滚。
四、想清楚是长期用还是试玩。试玩,直接用现成工具。
让她 24 小时待命不难,难的是让她 24 小时靠谱。
夜雨聆风