一篇给"被毕业论文折磨的商科研究生"的保姆级实操指南
先说结论,这不是标题党。
我用 Codex 走完了一篇实证论文的完整流程:下载数据、合并清洗、跑回归模型、按学校格式规范生成 Word 初稿。AI 干掉了大约八成的体力活,剩下两成是它干不了、也必须由你自己干的事——核对数字、判断结论、承担学术责任。
这篇文章把每一步的"坑位"都标了出来。跟着走,毕业论文从"进度 1%"到"100%初稿",真的可以做到。
一、安装:5 分钟,让 Codex 用上 DeepSeek V4 Flash
Codex 的安装就一条命令:
npm i -g @openai/codex# macOS 用户也可以:brew install openai-codex
装完先验证:codex --version 能输出版本号就行。
接下来是重头戏:把模型换成 DeepSeek V4 Flash。为什么选它?便宜、快,而且原生支持 Codex 用的 Responses API,不需要搭本地代理。DeepSeek 官方提供了一键配置脚本,照着官方文档跑就行:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)Windows 用户执行:irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
脚本会做三件事:把现有配置备份到 ~/.codex/backup-deepseek/、生成模型清单、改配置文件。运行后按菜单选 1(deepseek-v4-flash),再粘贴你的 API Key(去 DeepSeek 开放平台申请,sk- 开头)就完成了。想切回原来的配置,重跑脚本选恢复即可。
动手能力强的也可以手动改 ~/.codex/config.toml,核心就这几行:
model = ”deepseek-v4-flash”model_provider = ”deepseek”preferred_auth_method = ”apikey”forced_login_method = ”api”model_catalog_json = ”~/.codex/models.json”[model_providers.deepseek]name = ”deepseek”base_url = ”https://api.deepseek.com/”wire_api = ”responses”experimental_bearer_token = ”sk-你的Key”
💥 坑位 1:跑一键脚本前,先启动一次 Codex 让
~/.codex目录生成,否则脚本没地方写配置。💥 坑位 2:API Key 是"身份证",别截图发群里,别贴进代码仓库。泄露了就去平台吊销重开。
官方接入文档在这里:https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex/
二、数据下载:先搞清楚"模型要吃多少数据"
实证论文的第一步不是写代码,是列数据清单。正确顺序:先让 Codex 根据你的模型公式把需要的变量全部列出来,再去数据库下载。
以最基础的杜邦分析为例:
ROE = 净利率 × 总资产周转率 × 权益乘数= (净利润/营业收入) × (营业收入/总资产) × (总资产/所有者权益)
需要的数据就是净利润、营业收入、总资产、所有者权益,加上目标公司和可比公司的年度报表。这类数据在 CSMAR、Wind、iFinD 都能下到。
如果是回归类模型,数据清单会复杂得多,但有几个坑是通用的:
基期数据:模型里有滞后项(营业收入变动额、期初总资产),数据下载区间要比研究期早 1—2 年。 行业样本:不是只下目标公司!分年度回归需要同行业全部 A 股的数据,通常需要剔除 ST 和金融业,几十到几百家。 口径:合并报表不是母公司报表;年度数据不是季度数据;应收账款、存货取净额,固定资产取账面净额。 研发费用:2018 年前利润表不单列研发费用,它藏在管理费用里。跨年份研究要先统一口径,否则后面算出来的"异常"全是口径假象。 ST 是"逐年"剔除,不是一次性剔除——某公司只在个别年份被 ST,只剔那几年就行。
💥 坑位 3:漏下基期数据是最经典的翻车现场。等你把模型写好、代码跑通,回头发现差一年数据,那酸爽,谁补谁知道。所以第一件事永远是:把模型公式丢给 Codex,让它出数据清单,你逐项打勾。
三、数据处理:几百 MB 的表格,让 AI 干体力活
从数据库下回来的数据通常是"一个文件一张表",每张几十万行,Excel 打开就卡成 PPT。正确姿势是让 Codex 写脚本处理:
先读所有表的结构——字段名、行数、缺失率,检查数据可用性; 把需要的字段合并成一张"公司—年度"面板数据表,输出成 CSV 或 Stata 能直接读的格式; 脚本用流式读取,几百 MB 的文件不会撑爆内存。
这一步我踩过的坑,各个都是"经典款":
季度和年度数据混在一个文件里,还有合并报表、母公司报表两个版本 → 只保留"合并报表 + 12 月 31 日的年度行"; 数据里有大量"上期数"行(日期显示为 01-01),不删掉会重复计算,结果直接翻倍; 数值字段是科学计数法文本(1.23E+08),要转成真正的数字; 2023 年起证监会的旧版行业分类停更,很多公司行业代码是空的 → 用中国上市公司协会的新分类补位,两个口径先比对、再拼接、最后做稳健性检验。
💥 坑位 4:让 AI 每步都输出"质检报告":合并前后行数、关键变量缺失率、目标公司数据是否齐全。AI 干活快,但你要给它装一个质检员,否则它把重复数据算进去,你还以为是自己模型写错了。
四、模型分析:跑回归,配一个杜邦示例
数据处理完,重头戏来了。学术论文常用 Stata,而 Codex 最擅长生成 do 文件——一份从读数据到出结果表、全程无人值守的脚本。
拿杜邦分析当例子:
让 Codex 读取你的面板表,确认字段; 要求它计算目标公司 5 年的 ROE 及三个分解因子,顺便算行业均值、中位数做对比; 输出结果表和趋势图,图的格式按学校规范来。
💥 坑位 5(最重要的一条):模型结果一定要和年报事实交叉核对。AI 给你的系数再漂亮,也要先问一句"这数字和公司年报对得上吗?"对不上,先怀疑数据处理,别急着写进论文。
五、论文成文:从格式规范到初稿
这是最让人惊喜、也最让人抓狂的环节。正确做法:
把学校的《学位论文撰写格式规范》丢给 Codex 读——字体、字号、页边距、行距、三线表、页码规则,一条都别省; 让它按规范生成 Word 文档:公式用 Word 原生公式对象(不是截图,也不是 LaTeX 文本,否则你自己没法改),表格用三线表,图片图例不遮挡数据; 参考文献用 Zotero 生成,正文统一"姓名(年份)"引用格式,编号按正文首次出现顺序排列。
踩过的坑,每一个都值得单独交代:
增删文献后,编号、书签、正文角标要整体重排:按正文首次出现顺序重排,并同步所有跳转。 改完全文记得更新目录:Word 里全选目录按 F9。 版本管理:AI 可能拿错版本当基底,把你刚改好的摘要覆盖回旧版。让它把每个版本备份好,并写一份"修改日志"。 你亲手删掉的内容,AI 可能"贴心"地给你恢复:明确告诉它"这几处不得恢复",让它记录在案。
💥 坑位 6:永远保留"修改前备份 + 修改清单 + 修改日志"三件套。AI 的记忆是流动的,你的版本管理必须是固化的。
六、给 AI 下指令的三板斧
经验浓缩成三句话,任何环节都适用:
"先读取我的数据/文档,检查结构和完整性,再给方案"——让 AI 先看再说,别让它先写再猜; "每一步输出中间验证:行数、缺失率、前后对比"——给 AI 装质检员; "修改前先备份,完成后列出所有改动清单"——让每一次操作可追溯、可回滚。
七、避坑速查表(建议收藏)
~/.codex | ||
最后说点掏心窝的
AI 能帮你:下载数据、合并表格、跑模型、按格式排版、检查错别字和逻辑。
AI 不能帮你:核对每一个数字、判断结论是否严谨、承担学术责任。
论文的署名是你,盲审老师看的是你的名字。让 AI 干体力活,把结论、思考和表达留给自己——这才是"用 AI 写论文"的正确打开方式。
顺带一提,全程跑下来,DeepSeek V4 Flash 的花费也就几块钱,比一杯奶茶便宜。省下来的几个月时间值多少,你说了算。
转发给正在被论文折磨的同学,收藏这篇,从今天开始让 AI 给你打工。
夜雨聆风