乐于分享
好东西不私藏

社科生的AI工具攻略下

社科生的AI工具攻略下

      01文史哲专业:

古籍、档案、繁体竖排、影印件

这是文史哲学生经常碰到的一个问题:

你手上的不是干净的现代英文 PDF,而是繁体竖排、影印模糊、甚至手写的一手史料。通用翻译和 OCR 在这里基本歇菜。要用专门的古籍 OCR 工具(都偏免费/学术性质):

· 古联 OCR(ocr.ancientbooks.cn):中华书局旗下古联公司开发,基于机器学习,处理版刻、写本等各式古籍图像,有智能版面分析,双行夹注、眉批、行间批注、表格这类特殊版面都能较好处理,识别准确率可达 98%。提供即时修订和 doc 格式下载,有原图文对照、单列校对、折校三种校对模式。常规古籍版面用它比较稳。

· 识典古籍(kandianguji.com):在线古籍图像文字识别,排版方向可自定义(默认自动识别),提供 OCR API。

· 中文古籍 OCR 学术版(ocr.gj.cool):源自北京龙泉寺藏经办与华南理工深度学习实验室的合作,初始训练数据是汉文大藏经高清图,含单字识别、单列识别、检测。

· 云聪古籍数字化平台:支持约 8.7 万繁简汉字 OCR,涵盖大部分异体字,对手写字体也有较好精度,还支持蒙古语、藏语、维吾尔语、朝鲜语、哈萨克语等少数民族语言,识别率 95% 以上;能按规范导出双层 PDF、XML 元数据;还自带自动标点引擎。做民族史、边疆史、宗教文献的可以重点看。

注意:古籍文档识别整体上比现代文档滞后——因为缺大型训练数据集,所以古籍 OCR 的结果一定要校对,尤其单字识别模式下语序可能会错。把它当"帮你省下大部分录入工作"的助手,而不是"一键得到可用文本"的机器。(文言文转白话:有实验性的"文言文神经机器翻译"演示系统,初步结果还不错,但训练集很少,仅供参考、不能尽信。)

 02社会学/人类学/传播

       质性研究与访谈编码       

如果你做的是访谈、田野、焦点小组、开放式问卷,核心工具不是聊天 AI,而是质性分析软件(CAQDA)。

传统三大件(都已加入 AI 辅助功能)

· MAXQDA:被认为是 2026 年最强的传统质性工具之一,混合方法整合最好、对新手更友好,也是从 NVivo 迁移过来最常被推荐的目标。它的"AI Assist"能总结文档、建议编码、生成编码段落摘要,但需要接外部大模型 API(要你自己的 API key)。学术单用户版约每年 220 欧元起(商业版约 440 欧元),有学生/教育优惠价。

· ATLAS.ti:擅长可视化网络分析,部分做扎根理论(grounded theory)的研究者偏好它;处理多媒体数据灵活,但上手相对复杂。

· NVivo:曾经的行业标准,但在被 Lumivero 收购、经历几次不太顺的版本后,口碑有所下滑;仍然功能丰富,看你机构有没有现成授权。

AI 原生的新工具:

Skimle、UserCall 等把 AI 当主要分析引擎而非附加功能,能在几小时内处理几十份访谈转录,并保持每个发现都能回溯到原文段落。它们快,适合要速度的场景。但要权衡:这类工具能否满足学术方法的透明度和方法论严谨,要自己判断。

!!注意:直接用 ChatGPT、NotebookLM 这类通用 LLM 做质性"快速总结"是可以的,但它们缺乏为研究发现辩护所需的透明度——你没法在答辩或审稿时,清楚地把每个主题追溯回具体的原始段落。尤其对要写论文、要发表的人,这是硬伤。

实操小贴士:不同工具之间用 REFI-QDA(.qdpx)这个开放格式交换数据——NVivo、ATLAS.ti、MAXQDA 都支持。

数据隐私提醒

访谈录音、田野笔记往往涉及受访者隐私和 IRB/伦理审查要求。使用 AI 工具处理这类材料前,确认:

(a)数据是否上传到境外服务器;

(b)服务商是否会用你的数据训练模型。NotebookLM 不训练,但数据经 Google 服务器;国产工具数据在境内但隐私政策各异。对特别敏感的材料,考虑使用支持本地/离线模型的工具(如 Zotero + PapersGPT 插件、Ollama 本地部署)。

  03法学/政治学/公共政策

法条、判例、政策文件

一、查法条判例:

用专业数据库,或让 AI 接上数据库

· 专业法律数据库优先:北大法宝、威科先行、裁判文书网。北大法宝和威科先行两家功能差不多,都好用,以它们自带的检索结果为准。

·更进一步,让 Claude 接入北大法宝 MCP。 MCP 简单说,就是给 AI 外接一个权威数据源的接口——接上之后,Claude 是从北大法宝的真实库里取法条和判例,而不是凭记忆瞎编,做案情梳理和检索的可靠性会高很多。北大法宝现在注册就送一些额度,做法律相关的事很值得接上试试。

检索整理的其他路子:把一批判决书、政策文件传进 NotebookLM,让它只基于你上传的材料回答;或者用 Gemini 的深度研究、Google AI Studio(背后是谷歌的数据库,比较全面)做更广的检索。它们共同的好处是答案有据可查,不是凭空生成。

不管用哪种,AI 给的具体法条号和判例,最后都要回到数据库原文核对一遍。 接了 MCP 也一样:它降低出错率,但不等于免检。

二、合同 / 协议审核:

直接出修订版:把合同传给 Claude,它能直接在文档里改、输出一份修订版本,标出问题、给出修改,省去手动誊改。

一个好用的审核方法:

第一步,先让 AI 用表格把双方的权利义务一条条拆开——谁要做什么、什么时候做、做到什么标准、钱什么时候付、什么情况下能解除、违约了怎么处理。一张表就能看出哪里漏了、哪里含糊。

第二步,再让 AI 站在将来万一打官司的角度,分析哪些条款容易产生争议、举证上有什么难点,以及可以怎么修改、预留什么应对方案。

注意💡:有律所朋友反馈,经过几轮打磨后,AI 审出来的合同整体已经可用、需要人工再改的不多。但如果你没有相关背景、或者合同涉及较大金额和风险,AI 更适合当第一道筛子——重要的条款还是要自己看懂,必要时请专业人士把关。

三、读案卷、判决:让 AI 把案情梳理成图

一份冗长的判决书或仲裁裁决书,可以让 AI 提取核心要素,梳理成时间轴、当事人关系图、争议焦点,甚至生成一个可视化网页,让你几分钟就抓住案件全貌。银行流水这类数据也能让 AI 按时间分类收支、配对找规律,几分钟做完原来要一天的活。

四、政策文本分析

还是首选 NotebookLM:把政策文件、白皮书传进去,限定它只在你的材料里问答,它不从开放网络瞎编这一点在这里反而是优势。要做更细的编码分析,回到第二部分 B 的质性工具。

五、通用建议

把常做的动作固化下来:如果你经常写法律意见书、审同一类合同,可以在 AI 的系统提示词里先把身份、格式、审核角度设好,下次直接传材料就能出活,不用每次重写要求。

敏感信息走桌面端:涉及当事人隐私、未公开案卷的材料,优先用桌面端工具,别随手传网页端——网页端数据上云有泄密风险(此前 Kimi 网页端就出过简历泄露的事)。

04经济学 / 金融 / 商科:

    数据、计量、因果推断    

数据从哪来

国内实证数据:CNKI(知网)、Wind(万得)、CSMAR(国泰安)、EPS 数据平台、国家统计局、各地统计年鉴。上市公司、宏观、行业数据的主力来源。

数据库的检索和下载用它们自带的功能;AI 适合帮你想清楚要哪些变量、去哪个库找,而不是直接替你生成一份数据。

计量与统计软件

·Stata:经济学实证的主力,做面板、因果推断、回归比较多,命令生态成熟。

R / Python:免费、能力更全。Python 在数据清洗、机器学习、爬虫上更强,R 在统计和画图上传统深厚。

· AI 的使用:把你想做的分析(比如一个双重差分)翻译成可运行的 Stata / R / Python 代码,以及帮你读懂报错、解释结果。把它当一个随叫随到、不嫌你问得基础的助教,不要让它代替你做研究。

跑数据分析:

ChatGPT 的数据分析(原高级数据分析):上传 Excel / CSV 后,它在后台真跑 Python(pandas、statsmodels 这套),代码你能看、能复核,所以数字相对可信,单文件可到几百兆。

Julius AI:专做对话式数据分析,上传表格用大白话提问,它跑真代码出图和结论,适合十万行以内的数据集。

Claude:更擅长把跑出来的结果讲清楚是什么意思、对你的研究意味着什么,适合当解读和写作的搭档。

不管哪个工具,关键结论自己要能用原始数据复核一遍;让 AI 写的代码,至少看懂它在做什么再用。

因果推断这件事

AI 可以帮你梳理识别策略(工具变量、双重差分、断点回归各适合什么场景)、讲清楚平行趋势这类假设、帮你写检验代码。但用哪个识别策略、假设成不成立,是研究判断,等自己去斟酌。

   05心理学 / 教育学:

   实验、量表、统计

跑统计:ChatGPT 数据分析 / Julius AI:把数据传进去,让它做 t 检验、方差分析、回归、信度分析,它跑真 Python 出结果,还能解释每个数字、帮你写结果部分。比在 SPSS 里点菜单的好处是,能用中文追问"这里该用哪种检验""前提条件满不满足"。数字以它真跑的代码为准,别信它不跑代码直接说的 p 值。(免费统计软件 jamovi、JASP 装一个用来复核、或做贝叶斯分析。)

生成实验代码:Claude / ChatGPT:做反应时实验,把试次流程、刺激、计时要求描述清楚,让它直接生成 PsychoPy 脚本,你再在 PsychoPy 里调。不想写代码的,用在线实验平台 Gorilla(gorilla.sc)可视化搭建。

·打磨问卷量表:任意聊天 AI:把题目发给它,让它挑出双重否定、诱导性、语义重复的毛病,或把一份英文量表的表述本地化。但成熟量表必须用经过信效度验证的版本,别让 AI 凭空"造"一套量表拿去用。(发放用问卷星 / Credamo / Qualtrics。)

做元分析:Elicit:用第一部分的 Elicit 加速文献筛选、批量提取样本量 / 效应量;纳入排除标准和最终判断仍要人定,按 PRISMA 规范留痕。

06量化与计算社会科学:

文本、网络、爬虫、空间

文本分析

让大模型做标注 / 分类 / 情感 / 主题:把一批评论、政策、社媒文本交给 GPT、DeepSeek、Claude 打标签,做课程作业、小课题、内容分析都很快。量少直接在对话框里贴进去问;量大了就调它们的 API 批量跑,提示词里给几个标好的例子(few-shot)效果会明显更好。

更严谨的用法:用嵌入(embedding)聚类找主题:与其让 AI 直接"读出"几个主题,不如先用嵌入模型(OpenAI 的 text-embedding、智源 BGE 等)把每条文本转成向量、再聚类。好处是主题从数据里自己聚出来,你也更清楚它们是怎么冒出来的,而不是 AI 拍脑袋甩给你几个词。这步代码让 AI 帮你写就行。

AI 标的标签不是百分百准,自己抽一小部分核对一下它标得对不对,心里就有数了。要是这份分析以后打算写进正式论文,再补上算一致率、交代用了哪个模型和提示词这些规范动作。

网络分析

让 Claude / ChatGPT / DeepSeek 写 Python(NetworkX)或 R(igraph)代码,算中心性、找关键节点、做社群发现,并让它用大白话解释每个指标在衡量什么;想出图就导进 Gephi。把你的数据长什么样、想看什么说清楚,就能得到想要的脚本。

数据采集(爬虫)

让 Claude / ChatGPT 写和调 Python 爬虫(requests、scrapy,动态页面用 Playwright)采公开数据——把目标页面、要抓哪些字段描述清楚,它给你代码,报错再丢回去让它改。不想写代码的,用八爪鱼、后羿采集器这类可视化工具。但注意要遵守网站的 robots 协议和服务条款,不能碰个人隐私和受保护数据。 

 空间数据 / GIS

让 AI 写 GeoPandas 或 PyQGIS 脚本,做空间连接、缓冲区、核密度、画图,并帮你搞清坐标系和投影这些最容易出错的地方;不写代码就用 QGIS(免费)/ ArcGIS(机构授权)点图形界面。

数据清洗 → 分析 → 出图,可以让一个会写代码的 AI(Claude、ChatGPT)从头带到尾。学习阶段最大的价值,是你能借它快速把一个完整的量化流程走一遍、看懂每一步。

ai只能作为辅助

不能代替你做研究

撰文|chinn1

排版|chinn1