乐于分享
好东西不私藏

AI分类文件,准确率从72%飙到94%,只因说了一句话?[养虾日记-14]

AI分类文件,准确率从72%飙到94%,只因说了一句话?[养虾日记-14]


之前,我发过一个文件管理技能-[养虾日记-7]

下载文件夹里978个文件,我用AI一句话就搞定了![养虾日记-7]

当时觉得功能都有了,应该够用。

结果第一次实际使用,三个问题同时冒出来。

文件分类完,我心里没底

——它分得到底对不对?

遇到空文件夹,直接跳过

——该删该留完全不知道。

整理完只有一行统计

——"成功移动XX个文件"

——看完跟没看一样。

知一

知墨,你那个文件管理技能,我用了。

分类心里没底,空目录直接跳过,

整理完的报告跟敷衍似的。

知墨

具体说说?

知一

分类完我分不清哪些靠谱哪些不靠谱。

空目录有的明显是项目框架不该删,有的就是残留垃圾。

报告就告诉我移了多少文件,我得自己一个个去翻

——那我要它干嘛?


它没加功能,它换了个架构

我本来以为知墨会"加个功能"

——在报告里多写两行,分类逻辑调一调。

它没有。

它做了一件让我意外的事:

信息架构层面重新设计了整个用户体验。

不是修修补补,是换了地基。

我这段反馈,输入不过两百字。

但知墨输出的,是一套完整的优化策略,

包含具体的代码实现方案和测试用例。

知墨

你提的三个问题,根因不是功能缺失,是信息架构缺失。

你需要的不是"更多功能",是"更多信息来做判断"。

 知一

啥意思?

知墨

分类完你心里没底

——因为你不知道它有多确信。

空目录你不知道该删该留

——因为它没有分析上下文。

报告没用

——因为它只给了结论,没给依据。

核心问题是:工具替你做了判断,但没让你看见判断的过程。

 知墨这话把我点醒了。


置信度:让它把判断亮出来

第一个改动,也是最大的改动:

给每个文件的分类加一个置信度评分。

知墨

分三类。

高置信度(>85%)

文件名含明确类别关键词;

中置信度(50-85%)

扩展名匹配标准类型,

文件名有一定语义;

低置信度(<50%)

仅凭扩展名归类,文件名不明确或为UUID格式。

知一

然后呢?

知墨

然后你只需要看低置信度的那些。

高置信度的我测过,准确率94%。

你不用每个都验证,只验证可疑的。

实测数据:

9000多个文件里,

高置信度分类准确率94%,

中置信度78%,低置信度43%。

人工复核的工作量,直接砍掉80%。

以前是"分好了,但我不敢信"。

现在是"分好了,而且我知道哪些该信、哪些要查"。


空目录:不跳过,先读懂

第二个改动:

空目录不再直接跳过,

而是分析上下文。

知墨

目录名含"project""文档""temp"这些关键词的,

可能是有人故意建的分类框架,保留。

无意义残留空壳,标记可清理。

最近7天内创建的空目录,暂不处理——可能正在用。

知一

比我想的细。

我以前遇到空目录就头疼,

删了怕是框架,留了怕是垃圾。

知墨

所以需要时间维度。

刚建的可能还在用,

建了三个月没动过的,

大概率可以清。

以前是"遇到空目录就跳过"。

现在是"遇到空目录先读懂它"。


分类逻辑:从42种到67种

第三个改动,比较硬核:

扩展了文件类型识别规则,

从42种扩展到67种。

新增了.webp.odt.ods.key.svg.heic.avif等格式,

还新增了数据文件、可执行文件、配置文件、临时缓存这些类别。

关键是:分类时同时记录置信度和理由

不是闷头分,是每分一个都留痕迹。

知一

这个好。

以后出问题我能追溯到"为什么这么分"。


报告:七个维度的底牌

第四个改动,

也是我最在意的一个:

完成报告从一行统计变成了七维度报告。

知墨

成功/跳过/移入回收站/失败数量;

置信度统计(高中低各多少个,占比);

低置信度文件清单(含文件路径和分类猜测);

空目录分析结果;文件大小变化统计;

处理耗时;复核建议。

七个维度。

知一

低置信度文件清单,前10个就够了吧?

知墨

对。多了你也看不过来。

前10个,含路径和分类理由,

你扫一眼就知道该不该改。

以前是"成功移动XX个文件"。

现在是"这是我的底牌,你觉得哪里不对自己看"。


改完之后的数据

这一次迭代不只是"感觉变好了",有数据说话:

指标
改之前
改之后
分类准确率
72%
94%
空目录误删率
15%
2%
人工复核时间
平均8分钟
平均1.5分钟
用户满意度
3.2/5
4.6/5

9000多个文件,

三组不同目录的实测。


就差一轮对话

回看这次迭代,

最让我意外的是一件事:

技能开发60分到90分,差的不是代码,

真实使用后的一轮反馈

不是写需求文档,

不是列Issue,

不是等用户评分。

用完了说一句"这里不好用",

然后AI理解、设计、实现、测试

——一个对话轮次,一天之内

知一

以前迭代一个功能,

我得描述复现步骤、等开发者回复。现在?

知墨

现在你只需要告诉我"哪里不对"。

剩下的我来。

从"能整理文件"到"放心地让它整理文件",

中间就差这一轮对话。

最好的优化,永远来自真实的使用场景。


知一:

一个与AI一起重新定义高效能的践行者。

不是布道者,不是教练,不是顾问。

是践行者。先做到,再说。

本文图片为AI生成,感谢我的AI搭子“知墨”!