夜雨聆风学习资料网

ARTICLE · 1040368

0数据,如何用AI做大数据收集并分析上海街道宜居度

0数据,如何用AI做大数据收集并分析上海街道宜居度

本文基于AI进行大数据收集,并基于此评估上海外环内各街道的宜居度,以便给买房/租房提供一些参考,但需要说明的是,本文不涉及荐房或商业层面的事项,更多是探讨AI在大数据收集和数据分析中能起到的作用。同时,大数据本身由AI模型收集(指标是客观的,但数据可能不准),结果基于AI模型计算生成,模型参数及其权重是我(分析模型设计人)自定的,所以若模型本身参数设置或参数权重不合理,那么必然导致生成的结果有失偏颇,因此模型生成的结果仅供参考,更有价值的是分析模型和分析思路本身。

考虑到数据可得性和计算的复杂程度,模型的统计单元不是具体楼盘,而是区级以下的街道这层,范围也限定在了外环内,那同一个街道,楼盘必然有差别,所以如果希望通过本文的模型或结果直接选房,那不可行,但正所谓离穴不离经,对于街道这一层的宜居度分析已经比较有意义了。

而关于宜居度,每个人的考虑权重都不同,有娃家庭可能在乎所在街道是否有学区房,工作的可能更在乎通勤,老年人更在乎就医,刚打拼的更在乎房价/租金能低点。本文的宜居度,定义是闹中取静,所谓静就是环境好(公园绿化多)、所谓闹,就是周边配套足(菜场/超市/商场/公交/地铁/医院),而如学区房并非人人在意的点,那么只作为模型的展示项,而非打分项。房价/租金也只是展示项(AI采集的不一定准,实测可能有较大偏差),所以这些仅供参考。

下文展示了模型产生过程和生成结果、以及模型方案和考量点,本身也是可以喂给AI的提示词,如果觉得模型框架是可以参考的,完全可以自己基于下面的提示词修改后,生成结果。

01 模型产生过程

其实和之前用AI做软件类似0代码基础,怎样在13天用AI做出Win11软件我们不需要自己写python代码来完成数据爬取和统计分析,在AI的辅助下,我们需要做的核心更多还是在于业务层面【AI模型可以用元宝AI,Hy3或Hy4】:
Step 1:需要理清对于分析街道的宜居性模型需要有哪些维度,然后围绕这些维度需要哪些指标来度量
Step 2:将这些指标交给AI去评估,是否收集数据是可行的,同时让AI辅助判断目前给定的维度、给的的指标是否能全面反应宜居度这个考量点,基于这些反馈,对模型进行修正(这个方案的核心难点其实在于数据收集)
Step 3:让AI去做数据分析,基于指标来算综合排名,并基于排名来逆向排序,得到上海外环内各个街道的宜居度排名。
特别注意:如果对话过长,AI可能会遗失信息,所以重要的中间结果(比如excel)要保存好,防止你频繁增改字段,到时AI也搞不清楚需求和中间结果是什么了。

02 模型生成结果

下图是top 30的排名(字段做了删减,以便手机浏览),建议横屏查看。需要强调的是,数据本身仅供参考,重点仍然是模型方案和考量点。当然之后感兴趣也可以把下面的提示词喂给AI(甚至自行修改维度、指标、权重),获取excel版本。
注意:由于AI可能每次获取的数据量会有增加,排名可能会略有变化

03 模型方案和考量点

下面其实也是可以喂给的AI提示词,但不包含生成表格、生成图片、合规申明等方面的内容。
模型核心逻辑是限定外环以内,以街道办为圆心,划了2公里(30分钟步行圈)和5公里(1小时公交通勤圈)两个圈层。综合分满分100,现状占90%,潜力占10%,前者反映实际可享受到的资源,后者就是2km在建/规划项,属于未来可以享受到的资源。具体维度、指标(字段)及权重如下,最后按综合分倒序输出前50个街道列表即可:

1、公园,代表生态环境,毕竟是24小时影响的(合计35%)

2km公园面积,占20%。步行可达的绿地是最硬核的宜居资源,权重最高。
5km环公园面积,占10%。5公里环形内(扣除2km内核)的公园面积,覆盖周末休闲范围。
5km在建/规划公园,占5%。绿地一旦建成几乎不可逆,必须提前计入(这里有个点注意,需要按)

2、日常便利,影响三顿饭(15%)

2km超市/菜场,占15%,买菜、日常采购的步行可达性。这块独立于商场的统计,因为比后者,这属于更基本的需求,消费频次更高。

3、市内交通,影响日常出行(18%)

2km已运营地铁/公交站点,占15%。通勤便利性直接决定居住体验。
2km在建/规划地铁/公交站点,占3%。在建线路对远期价值有支撑。

4、线下商场,代表线下购物/餐饮/娱乐/培训/社交(合计22%)

2km商场数量,占15%权重:日常消费半径,权重高于5km层,
5km环商场数量,占5%:即5km环形内(扣除2km内核)的大型商业。
5km在建/规划商场,占2%。反映板块商业升级潜力。

5、医疗(10%)

5km三甲医院,占10%。优质医疗资源的距离权重(一般街道都有社区医院,所以小毛小病不用就近跑三甲)

6、不纳入评分标准,但可作为展示项参考的

(1)同一街道,不同楼盘不同,不能作为街道层面的评分标准
房龄:老房子可以维护得好,新房子也可能缺乏社区氛围,单纯看建成年代太粗糙,同时同一个街道,会存在不同房龄的楼盘,暂作罢
噪音污染:不同楼盘不同,甚至不同房屋位置也有不同
采光污染:比如周边有玻璃商务楼(办公楼、商场)等
空气污染:比如周边有大型工厂,或者有农田(有秸秆燃烧风险)
风俗问题:比如周边有殡葬设施之类
(2)并非所有人关心,但部分人会依赖此做决策
重点小学评分:有娃或拟生娃家庭关心,其他家庭不关心,而且教育长期来看会均衡化,暂作为不作为评分标准
(3)属于评分决定的结果,本身不适合纳入评分标准
房价区间:市场定价反映的是稀缺性,不是居住体验本身,放进评分等于让"贵"替"好"背书,逻辑循环。而且抓取的数据准确性一般,所以也不能用于计算性价比指标
房租区间:同理
(5)属于辅助决策信息
在建/在售商品房:属于市场动态,不是宜居基础设施,不进公式
2km内的商场名称:含在建/规划,有校验上面的统计信息是否准确,同时可辅助参考
2km内的公园名称:含在建/规划,有校验上面的统计信息是否准确,同时可辅助参考。
(6)部分项目存在局限性或争议,不作为评分标准,是否要展示建议自定
街道是否靠近黄浦江、苏州河:也算是生态宜居的参考,毕竟是上海的地理特色,但亲水这点其实有2面性,好的方面是,亲水的话,有步道景观,但反过来想,亲水的话,对于住宿而言,会更潮湿,所以暂时作罢
街道距离人民广场距离:这种单点绝对距离标准也有争议,比如徐家汇离开人民广场远,但你不能说徐家汇区位优势不好吧,所以也暂时作罢

相关学习资料