乐于分享
好东西不私藏

我设计了一个聆听大自然的电台APP:窗外电台

我设计了一个聆听大自然的电台APP:窗外电台
已关注
关注
重播 分享
我设计了一个聆听大自然的电台APP:窗外电台。

一、为什么要做这个?

窗外的鸟在叫什么?夏夜里此起彼伏的是哪一种虫鸣?雨后突然热闹起来的蛙声意味着什么?一条溪流、一阵风、一场雨,又在讲述怎样的自然故事?
我们始终和自然共享同一个空间。鸟鸣、虫唱、蛙声、风雨、溪流并没有消失,只是在现代城市生活里,它们越来越容易被归为模糊的“背景音”。
我们不是听不到自然,而是越来越少真正听懂自然
现有自然声音产品大致存在两种典型形态:
专业自然声音识别工具:录下一段声音,返回物种名称和置信度;
自然白噪音产品:播放森林、雨声、溪流、海浪等预先录制或循环的环境音。
前者解决“这是什么”,后者解决“我想听一点自然声音”,但两者之间仍缺少一种更面向普通人的产品:

让真实自然本身成为一种值得持续收听的内容。

用户不需要先成为鸟类爱好者、生态研究者或者环保志愿者,只需要像打开音乐、电台或播客一样,打开一个真实的自然现场。AI 在背后帮助他听见其中的生命、理解此刻正在发生什么,并在产生兴趣时继续探索。
这就是「窗外电台」想解决的问题。

二、产品方案

「窗外电台」是一款以真实自然声景为内容源、由 AI 负责识别、理解和编排的自然声音电台。
“窗外”是人与自然之间最日常的一扇入口。一扇窗外可以是一只鸟、一场雨、一阵风;再往外,可以是一座城市公园、一片湿地、一条溪流、一座森林、一处动物园,甚至一个正在经历季节变化的自然保护地。
我们希望用户通过一个非常轻的动作进入自然:打开电台,听见正在发生的自然。
产品不合成一个“更完美的森林”,也不把真实声景处理成只有鸟鸣、没有风雨和城市远景声的纯净素材。相反,我们尽可能保留真实环境中自然发生的变化。远处的车声、突然变大的风、雨滴落在屋檐、一只鸟加入又离开——这些声音共同组成了人与自然真实共处的环境。
AI 的作用不是替自然说话,而是完成四件事:
识别:听出鸟、虫、蛙、风、雨、水流等不同自然声音;
理解:结合时间、环境和自然知识,判断这段声景正在发生什么;
编排:从连续录音中找到值得听的片段,并组织成可消费的节目;
解释:在用户真正好奇时提供少量、恰当的自然字幕和背景知识。
因此,「窗外电台」的核心不是“AI 生成声音”,而是:把RawNature Audio 转化为普通人愿意消费的 Nature Content。

三、核心体验与用户路径

整个产品围绕三条连续的用户行为展开:

听自然

用户打开小程序,首页首先看到:

此刻,自然正在发生。

内容不是物种列表,而是一组经过 AI 整理的真实自然现场,例如:
雨后的城市公园:一场夏雨刚刚结束,鸟鸣重新出现,屋檐还在滴水;
清晨的湿地:蛙声正在退去,晨间鸟声慢慢接替夜晚;
夏夜的山林:虫鸣成为主角,偶尔可以听见远处的蛙声和风穿过树林;
溪边十分钟:持续水流构成稳定底色,偶尔有鸟鸣从远处穿过。
用户不需要先学习知识,只需要像听歌一样点一下播放。
为了降低选择成本,用户还可以直接对 AI 说:
“我想听一个安静的夏夜。”
“找一段雨刚停的声音。”
“给我一段适合工作时听的溪流。”
“今天想听鸟多一点的。”
AI 不生成一个虚构的自然声景,而是从真实声音内容中找到最符合当前需求的一段。

听懂自然

播放过程中,自然声始终是主体。
AI 不持续讲话,而是像音乐播放器显示歌词一样,在值得理解的声音出现时提供“自然字幕”:
🐦白头鹎:刚刚出现
🌿风吹树冠:持续
💧屋檐滴水:背景
如果用户只是想放松,可以完全关闭字幕和解释。
如果用户对某个声音产生兴趣,可以点击:

刚刚那个是什么?

系统回到对应片段,对目标声音进行增强,并结合当前时间、环境和自然知识进行解释:
可能是什么声音;
为什么会在这个时间和环境出现;
这段声音在整个声景中处于什么位置;
下次可以怎样自己辨认。
自然教育不再是“进入学习中心看百科”,而是在真实收听过程中自然发生:

先听见,再好奇,再理解。

分享自然

普通用户也可以把自己遇到的真实自然接入电台。
当用户在窗边、公园、溪边、露营地或旅行途中遇到值得分享的一段自然声音,只需要点击:

开台

手机录制完成后,AI 自动完成:

音频质量检测 → 人声及隐私内容检测 → 自然声音事件切分 → 声音识别 → 时间与场景理解 → 节目标题与字幕生成 → 用户确认 → 发布

例如,一段普通手机录音最终可以变成:

《雨停后的十分钟》杭州 · 17:42 鸟鸣 / 雨滴 / 风 / 城市远景声

用户不需要懂物种,也不需要填写复杂标签。他只是觉得:

这一刻很好听。

于是把这一刻分享给别人。
产品首先满足用户收听和分享的需求,公众参与与自然数据沉淀则在使用过程中自然发生。

四、AI 能力与技术实现

「窗外电台」不是在普通播放器上增加一个大模型问答框。AI 从自然声音进入系统,到最终成为节目内容,贯穿整个链路。整体技术思路如下:
其中几个关键点:

自然声音识别

系统首先需要从复杂环境声中识别和区分:鸟鸣、虫鸣、蛙声、风、雨、水流以及其他典型自然声音。

声音事件时间轴

连续自然录音被拆解为结构化事件,例如:
00:08 鸟鸣出现
00:17 风声增强
00:31 第二种鸟声加入
00:46 雨滴减弱
01:02 虫鸣持续
这条时间轴是自然字幕、AI 导播和节目编排的基础。

AI 导播

自然录音往往连续、漫长且信息密度不均。AI 需要进一步判断:
哪一段值得保留;
哪些声音值得提示;
声景什么时候发生明显变化;
这段声音适合如何命名;
哪些知识值得解释;
什么时候应该保持安静。
相比单纯“识别物种”,AI 导播解决的是:如何把真实自然组织成用户愿意听的内容。

上下文理解

自然声音不能脱离时间和环境解释。
系统结合声音结果与:时间、生境、天气、粗粒度地点。

自然知识库

生成与当前现场相关的解释,而不是输出脱离场景的百科知识。

隐私与安全

公众“开台”可能包含人类对话和精确位置信息,因此系统默认增加:人声检测、明显私人对话阻断、地理位置模糊化、发布前用户确认、对珍稀物种敏感位置进行保护。
在连接自然的同时,也保护人的隐私和自然本身。

五、创新与项目价值

「窗外电台」的创新不是重新做一套鸟类识别模型,而是重新设计自然声音进入普通人生活的方式。传统自然声音产品通常是:自然声音 → AI 识别 → 物种名称。
「窗外电台」希望形成另一条链路:真实自然发生 → AI 感知和理解 → 整理成值得听的自然节目 → 用户持续收听 → 产生兴趣与自然认知 → 部分用户分享自己遇到的自然 → 形成更多真实自然内容与数据。
它带来三个变化:
从“识别工具”变成“自然内容”:AI 不只回答“这是什么”,还帮助用户理解:这里现在正在发生什么?为什么值得听?
从“主动学习”变成“在收听中自然理解”:用户首先因为内容本身好听而进入产品,知识和科普在好奇发生后出现。自然教育从一个额外任务,变成日常内容消费的一部分。
从“要求公众贡献”变成“使用本身产生公共价值”:用户分享真实自然声音的第一动机可以只是:“这一刻很好听。”,这些内容长期可以服务自然科普、公民科学、城市声景研究和公益机构。
人与自然的连接,不一定始于远行,也不一定始于专业知识。它可以先从重新认真听一次身边的自然开始。