ARTICLE · 1104009
最近开发了一款软件,让 AI 帮我管理照片
这两个月,我利用空闲时间写了一个 AI 照片库软件。
想法很简单:现在大模型已经这么强了,如果把它用到自己的照片库上,除了传统的浏览、分类和搜索,还能玩出什么新花样?
基础功能

普通相册软件该有的功能都得有:按时间线浏览、查看 EXIF 信息、相册、人脸识别、地图等。

索引
索引是实现各种高级功能的基石。目前做了四类索引:
CLIP:为每张照片生成语义向量,既能用文字描述搜图,也能找相似的照片; 人脸:检测照片中的人脸并聚类; 元数据:读取 EXIF 信息,GPS 坐标会换算成地名; 视觉描述:用视觉大模型(VLM)给每张照片写一段文字描述,同时把图里的文字抄录下来(OCR)。
视频会先抽取关键帧,再按同样的方式建索引。

和照片库对话
有了索引,再加上大模型,就可以直接和照片库对话。
比如可以问:
「我和某某一起去过哪些地方?」
或者:
「帮我找出地点在回龙观,而且画面里只有一盘菜的美食照片。」
我一直有个习惯:买了东西之后,会顺手把说明书、标签、设备背面的贴纸拍下来备查。
但真正需要的时候,往往翻不出那张照片。
现在就可以直接问 AI:
「我的路由器密码是啥?」

记忆与猜测
对话中,AI 会把了解到的信息存进记忆,比如人物之间的关系、住在哪里、在哪里工作,之后回答问题时会用到。

除了我直接告诉它的,AI 还能从大量照片中分析出一些事实。AI给负责这件事的角色起了个名字,叫「图书馆员」。图书馆员每天夜里对整个照片库做统计分析,再让大模型做少量推理,得出一些猜测,比如「家应该搬过一次」「这几个人常一起出游」。
这些猜测带有置信度,会作为线索参与推理。图书馆员也会拿它们来问我:我确认了,就写进正式记忆;我否认了,就删掉。
我本来以为睡眠时梳理记忆、提炼知识是我的独创,查了一下才发现大家都想到了。这种行为在神经科学里叫"睡眠依赖的记忆巩固(memory consolidation)",用在AI领域叫做sleep-time compute。
自动相册
很多照片管理软件都能自动生成相册,有了大模型,这件事可以做得更好。

AI 会按旅行、地点、人物、主题等多种线索把照片归成相册,给相册起名、写描述,还能为相册单独生成 HTML 页面和视频。
换句话说,它不仅是在“分类照片”,也开始有一点“策展”的味道。
生成视频
给一组照片生成视频,发挥空间更大。
传统的照片视频,基本就是图片轮播、缩放、转场,再配一段音乐。
大模型可以自己当导演:先理解这一组照片在讲什么,再设计故事线、安排镜头顺序、写字幕和旁白,然后调用各种工具完成剪辑。
甚至还可以调用三维软件,生成一些原本并不存在的场景和视觉结构,把照片放进去。
下面这张截图,就是AI调用Blender把一组照片挂在了一棵虚拟的树上:

工作量
开发总共花了60多个小时,其中我自己投入的大约10几个小时,其余时间是AI在干活。开发工具用的是Claude Code,视频部分有一些创意是 Codex做的,因为GPT-6的视觉能力强。
建索引用的模型(CLIP、人脸、视觉描述与 OCR)都是开源模型,跑在家里的一块显卡上。对话、起名、策展这些需要「思考」的环节调用的是 DeepSeek 的云端 API。
另外也提供MCP接口,这样可以连接我的GPT或Claude的订阅,使用更先进的模型,同时少花API token费用。
软件还在继续开发和完善,大家如果有好玩的思路,欢迎留言告诉我。