乐于分享
好东西不私藏

不写一行代码,AI 编程助手 token 费省 60%+ —— Paritok 免费/收费全攻略

不写一行代码,AI 编程助手 token 费省 60%+ —— Paritok 免费/收费全攻略
你每天让 Claude Code / Cursor 干活,有多少 token 花在了"重复发同一堆工具定义"和"一遍遍重读旧文件"上?答案是——可能一半以上。今天要聊的这个开源项目 Paritok,就是专门干这个的:它横在 Agent 和大模型之间,把请求先压缩再转发,最多能省 60%+ 的 token,而且"压缩过的原文一个字节都不丢"。免费自托管、付费云加速两种玩法,我都在手机上帮你实测过了,真假踩坑全写在下面

一、这是什么?

Paritok 是一个架在「AI 编程 Agent(Claude Code / Cursor / Codex 等)」和「LLM API」之间的开源压缩网关。它像一道透明代理横在中间,把你要发给大模型的请求先变小一点再转发,从而大幅削减输入 token 的费用。
核心卖点一句话:不需要改动你的一行 Agent 配置,只要把 BASE_URL 指到它,它就自动帮你省钱——而且压缩是可无损恢复的。
它背后是一套专门为「编程 Agent 场景」训练的 4B 参数压缩模型(基于 Qwen3-4B,Apache 2.0 开源权重),抓取了 4.5 万条真实编程会话轨迹来训练。

二、它解决了什么问题?

编程 Agent 每次发请求,真正费 token 的是三大块:
① 工具 Schema(最费)
编码 Agent 往往暴露 70+ 个工具,每次请求都把完整 JSON schema 全发一遍,动辄 2~3 万 token,但大多跟当前任务无关。
② 文件读取 / 工具输出
每读一个文件、跑一条命令,结果就塞进上下文,而且会一直重发到会话结束。
③ 历史消息
会话越长,前面的话每次都跟着重发,越长越胀。
Paritok 的三个杠杆:
杠杆一|工具过滤
语义筛选工具,只保留跟任务相关的几个完整 schema,其余 stub 掉。这是单轮最大收益,典型约 29K → 8K token。
杠杆二|内容压缩
用 4B 模型把文件读取、工具输出、旧历史压缩到约 26%,但保住函数名、路径、错误串这些关键信息。
杠杆三|历史总结
上下文快满时,把窗口外的旧轮次总结压缩,让长会话不溢出。
关键:它是「非破坏性」的
所有被压缩的内容都带 [REF:id] 标记,Agent 随时可以调用 read_original 把逐字节的原始内容拉回来。压缩只是省路上的 token,关键时刻一个字节都不丢。
能省多少?(官方数据)
▶ 单轮约 25%,长会话 20 轮可达 60%+,封顶约 72%(MCP 重载可达 78%+)
▶ 同样的上下文窗口,能塞下约 3 倍的对话轮次
▶ 官方实测压缩率:模型压到 25.7%(相当于 gpt-4.1-mini 的 2 倍狠)
▶ SWE-bench Lite 上保留 86.5% 的解题质量

三、收费 vs 免费——两种用法

这是很多人最关心的,我帮你彻底理清。
💰 免费方案:自托管(Self-hosted)
特点:
· 完全免费(Apache 2.0 开源),模型权重、网关、训练脚本全部开源
· 用自己的机器跑那个 4B 压缩模型
· 最省事的方式是 Ollama:ollama pull paritok/paritok-4b-v1(约 2.5GB,q4 量化)
· 需要一台 x86_64 机器(官方 Ollama 只正式支持 x86_64)+ 够跑 4B 的硬件
操作:

装 PyPI 包(含网关 + CLI)

pip install "paritok[proxy]"

拉模型 + 启动代理(首次)

paritok up
默认监听 8080 端口。
💵 收费方案:Paritok GPU 服务器(Hosted GPU)
特点:
· 不用自己跑模型,压缩在 Paritok 官方服务器上完成
· 定价:$0.30 / 每 100 万 token(按被压缩处理的部分计费)
· 去 paritok.com 的 Dashboard 建 API Key(形如 pk_live_...)
· 改一个配置开关即可
操作(paritok.yaml):
use_gpu_server: true
gpu_server:
base_url: https://www.paritok.com/api
model: paritok-4b-v1
api_key: "pk_live_你的key"

或环境变量 PARITOK_API_KEY

⚠️ 注意:官方曾宣布收费方案「2026 年 8 月底前免费」,9 月 1 日起正式收费。免费期可先体验效果再决定。

四、快速上手教程(最简路线)

无论免费还是收费,部署流程几乎一样,只是配置里那个开关不同。
第 1 步|安装
pip install "paritok[proxy]"

可选:要开工具过滤功能(推荐,收益最大)再加

pip install "paritok[toolselect]"
第 2 步|选后端
· 免费:配置 use_gpu_server: false,用 Ollama 跑模型
· 收费:配置 use_gpu_server: true + api_key
第 3 步|启动代理
paritok proxy --port 8080 --config-file paritok.yaml
第 4 步|把你的 Agent 指过来

macOS / Linux

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080

Claude Code

export OPENAI_BASE_URL=http://127.0.0.1:8080

Cursor / OpenAI 系

真实 API Key 照常留着,代理只改请求体、转发你的 Header 到上游。
第 5 步|验证
curl http://127.0.0.1:8080/health

{"status":"ok",...}

curl http://127.0.0.1:8080/stats

实时压缩统计,看省了多少

五、进阶:接入不同 Agent

· Claude Code:ANTHROPIC_BASE_URL 指向代理
· Cursor / OpenAI-SDK:OPENAI_BASE_URL 指向代理
· Groq / OpenRouter / Gemini:paritok proxy --openai-url <端点>,指到任意 OpenAI 兼容接口
· Codex:Codex 不读 OPENAI_BASE_URL,要开 codex.enabled: true,代理会自动写 ~/.codex/config.toml
· SDK 方式(不用代理):client = paritok.ParitokClient(anthropic.Anthropic()),可读 _paritok_savings

六、我的真实使用感想(含一次失败经历)

我在手机(ARM64 + Android)上实跑了一轮,说说最真实的感受。
先说好的:
▶ 云压缩质量确实好——我拿一段 2.4 万字符的长代码文档实测,压到 1334 字符(5.6%),类名、函数签名、缓存 key、业务逻辑全保住了,只砍掉重复和冗余。这个「保住该保的」能力,比通用摘要靠谱太多。
▶ 端到端链路搭起来很快,一个 pip install + 改 BASE_URL 就能接。
▶ 「非破坏性」的设计理念我很认可——压缩它只省路上的钱,要原文随时能拿回,这对编程 Agent 是安心的。
再说坑(这也是我劝退别人的部分):
▶ 我是想在手机上的 Minis 这个 Agent 里用它的,结果发现这条路走不通:即使代理在 9090 上稳定健康、带工具的请求也全部 200 正常,Minis 切过去依然无响应——Minis app 根本不向 127.0.0.1 的本地代理发包(有自己内部的网络通道)。
▶ 这个教训很有代表性:Paritok 是为「独立 CLI 类 Agent + 标准 BASE_URL」设计的。只要你的 Agent 能设 BASE_URL 指向本地代理,它就是神器;反之,如果你的环境是那种「app 内嵌、网络栈封闭」的 Agent,再完美的服务端也白搭。
我的总结评价:
Paritok 是在「Agent 上下文压缩」这条路上第一个把开源 4B 模型训练到能商用程度的项目,理念清晰、免费方案真正开源免费、压缩质量过硬。它特别适合:
· Claude Code / Cursor / Codex 玩家,长会话、读库多的场景,能实打实省 30~60%+ 的 token
· 想研究「给 Agent 省 token 的模型如何训练」的学习者(数据管线、评估、LoRA 训练全开源)
但如果你用的是封闭网络栈的情境 Agent,或本身就是超便宜模型,建议先想清楚「能否通过 BASE_URL 接入」和「收益是否真的划算」再动手。免费期拿真实任务压一压,看 /stats 的数字再决定留不留。

八、参考信息

官方仓库:https://github.com/Paritok-official/paritok-4b-v1
· 模型权重:https://huggingface.co/paritok/paritok-4b-v1(HF)
· 官网:https://paritok.com
· 语言:Python 3.10+ · License:Apache 2.0 · 版本:1.3.2
· 底座模型:Qwen3-4B-Instruct-2507
· 团队:两位工程师(Jiayu Shi + Luzhuo Chen),无大厂背景