Tokenazire实测:一次性把整个项目喂给大模型前
把整个项目文件夹塞给 Claude 或 ChatGPT 时,最烦的就是在对话中途突然被告知“输入过长”,然后得手动删文件重新试。为了解决这个痛点,我试用了 Tokenazire 这个 CLI 工具,它能直接在本地算出代码库占了多少上下文空间。
安装和使用逻辑大概是这样:
下一篇
AI vs Generative AI vs Agents →
它的逻辑很简单:通过 tiktoken 扫描本地文件夹或 GitHub 仓库(直接传 URL 即可),然后用颜色标出哪些文件是“Token 大户”。最实用的是它能直接计算出项目总量占模型上下文窗口(默认 200k)的百分比,不用再在那儿盲猜。
几个实操细节:
- 自动过滤:
.git、venv、node_modules这些噪音文件会自动跳过,不需要手动配置 ignore 文件。 - 一键打包: 用
--export参数可以将整个项目结构和文件内容合并成一个文本文件,直接复制给 LLM,省去了一个个文件手动复制的麻烦。 - 技术栈: Python + tiktoken + rich(终端渲染),非常轻量。
安装和使用逻辑大概是这样:
# 扫描本地目录并计算 token
tokenazire /path/to/your/project
# 扫描远程仓库并导出为可粘贴的文本
tokenazire https://github.com/user/repo --export这种工具对于需要频繁进行全项目重构或代码分析的人来说非常高效。比起手动估算,先跑一遍这个 CLI 能快速确定当前代码量是否在 Claude 3.5 或 GPT-4o 的承载范围内,避免在对话中途因为截断而导致 AI 逻辑丢失。
代码仓库路径:
https://github.com/DeKlain4ik/token-counter