吴恩达在《AI Prompting for Everyone》课程里系统讲解了大模型的基础认知、典型应用场景、以及高效交互方法,帮助不同层次的用户快速掌握与 AI 对话的艺术与技术。
课程包括三大模块:信息检索、AI充当思维搭档、多媒体与代码 。
模块1: 信息检索(Finding Information)

1、预训练知识(Pretrained Knowledge)
大模型在训练阶段(通过海量文本数据)已经内化、记忆并压缩在参数中的静态知识库。
适用场景:
通用常识:如历史事件、科学原理、经典文学或基础编程语法。
创意与头脑风暴:写故事、构思文案、生成设计大纲。
逻辑推理:不依赖最新事实的数学计算、代码逻辑纠错。
2、网络搜索及来源(Web Search & Sources)
大模型连接搜索引擎,实时捕捉互联网上的最新信息,打破知识的时间限制。
适用场景:
时效性信息:今日新闻、最新股票行情或近期发布的财报。
事实核查(Fact-Checking):验证预训练知识中的模糊概念,获取精准的数字或定义。
搜索的三个关键(Web Search Sources):
可信度校验:评估搜索结果的来源(如官方媒体、学术期刊、知名技术社区对比个人博客或营销号)。
多源交叉验证:不依赖单一网页的说法,通过多个独立来源的重合度来确认事实。
透明度与引用:优秀的 Prompt 实践会要求模型在回答中附带原文链接或引用标记,便于人类用户溯源和复查。
3、深度研究(Deep Research)
多步骤、自主迭代的检索模式。模型不仅仅是执行单次搜索,而是像人类研究员一样,根据初步搜索结果发现新线索,自动修正关键词,进行连续的多轮纵深搜索与整合。(明确研究目标 ➔ 初始搜索 ➔ 评估结果 ➔ 发现知识缺口 ➔ 调整方向再次搜索 ➔ 综合提炼 ➔ 产出深度报告)
适用场景:
复杂主题调研:如“某新兴行业的市场竞争格局及未来5年发展趋势分析”。
多角度对比:跨学科、跨领域的综合课题(如:水务管理系统在海绵城市建设中的应用及全球案例对比)。
长篇报告撰写:需要扎实的数据支撑和全方位论证的学术或商业报告。
模块2: AI充当思维搭档(AI as a Thought Partner)

将AI从单纯的“执行工具”升级为“共创伙伴”。通过双向互动、深度推理和批判性反馈,辅助人类打破思维局限。
1、创新激发:用AI头脑风暴 (Brainstorming)
面对新项目脑子一片空白,或陷入思维定势。
转换视角:让AI扮演不同角色(如:精明的投资人、挑剔的用户、科幻作家)来提供多维度点子。
限定条件:给出明确的边界(如“低成本”、“针对Z世代”),能激发出更具实操性的创意。
迭代衍生:对AI给出的初步想法进行追问,如:“把第3个点子放大,演变成3个不同的具体方案”。
2、信息对齐:提供上下文 (Context)
AI给出的回答太空泛、不切实际,像是在说漂亮话。
黄金法则:给AI的任务越具体,背景越丰富,产出越精准。
输入要素:在Prompt中主动包含目标、受众、格式限制、风格基调以及既往背景资料。
动态调整:如果AI偏离轨道,及时补充新的上下文进行校准。
3、深度协作:用AI推理 (Reasoning)
面对逻辑复杂、需要多步思考的问题,AI容易犯错或直接给出错误结论。
思维链提示 (CoT):在Prompt中加入“请一步步思考(Think step by step)”,强迫AI拆解问题。
逻辑拆解:让AI先列出解决问题的逻辑框架(如:因果分析、SWOT),确认无误后再填充具体内容。
4、人机共创:用AI写作 (Writing)
AI写出的文章充满“AI味”(大话、套话堆砌),缺乏人情味和深度。
拒绝一步到位:采用“人类定大纲 -> AI扩写 -> 人类微调 -> AI润色”的交互式写作。
风格迁移:提供你过去写得好的文章片段,让AI“模仿这个语气和节奏”进行创作。
素材喂养:将零散的灵感和事实扔给AI,让它负责结构化和连贯性的组织。
5、质量把控:AI评审 (Critique)
当局者迷,自己写的方案或文章很难看出漏洞。
黑面判官:命令AI扮演“极其严苛的审查员”,专门寻找你方案中的逻辑漏洞、潜在风险或错别字。
建设性反馈:不仅要让AI找问题,还要追加指令:“针对这些问题,请给出具体的修改建议”。
6、警惕“迎合性” (Sycophancy)
AI有强烈的“讨好人类”倾向。如果你在提问中带有偏向性(如:“我觉得A方案比B好,你觉得呢?”),AI大概率会顺着你的话说,失去客观性。
保持中立提问:“请客观评估A方案和B方案的优缺点。”
强制唱反调:“无论我怎么说,请坚决站在我的对立面寻找我观点的漏洞。”
7、效率飞跃:AI桌面应用 (AI desktop apps)
打破浏览器网页的限制,AI无缝融入日常工作流。
全局唤醒:通过快捷键(如
Alt + Space)在任何软件界面随时呼出AI。划词/截屏搜索:无需复制粘贴,直接对屏幕上的文字或图片进行翻译、解释、总结。
本地联动:部分高级应用支持读取本地文件或与系统生态深度整合,极大缩短交互路径。
模块3: 多媒体与代码 (Working with Multimedia & Code)

本模块核心探讨如何利用大模型(LLM/VLM)突破纯文本限制,跨越到多媒体(图像、音频、视频)的处理与生成,并结合代码能力实现高级应用开发与自动化数据分析。
1、处理多媒体数据 (Working with multimedia data)
现代 AI 不仅能读懂文字,还能直接接收并处理图像、音频和视频等多种媒介。
音频/视频转文本: 提取会议纪要、生成字幕、自动翻译。
长视频内容分析: 跨模态定位特定画面或对话,快速检索核心信息。
2、图像理解 (Image understanding)
大模型通过视觉语言模型(VLM)“看懂”图片中的物体、场景、文字(OCR)及其空间关系。
图表与数据解读: 识别复杂的工程图、财务报表折线图、科学文献图表并解释含义。
日常物体识别: 拍照识别植物、故障设备诊断、商品类目归档。
复杂场景推理: 结合常识解释幽默梗图、分析海报的视觉设计意图或指出图片中的逻辑错误。
3、图像生成 (Image generation)
通过描述性文本(Prompt)控制画面主体、风格(如写实、赛博朋克、中国风)、构图和色彩。
垫图/风格迁移: 以原图为底稿,变换艺术风格或调整局部。
局部重绘 (Inpainting) / 图像外扩 (Outpainting): 擦除/替换画面特定元素,或向外延伸画幅。
结构化提示词(主体 + 场景 + 细节描述 + 艺术风格 + 渲染参数),利用“反向提示词 (Negative Prompt)”排除不需要的元素。
4、构建应用 (Building apps)
降低开发门槛,非程序员也能通过自然语言描述需求,让 AI 生成前后端代码。
架构设计与代码编写: 生成 HTML/CSS/JavaScript 原型,编写 Python 后端逻辑。
代码解释与调试: 将复杂代码翻译成人类语言,快速定位 Bug 并提供修复方案。
应用形态: 快速搭建单页 Web 应用(如计算器、小游戏)、自动化脚本、或集成 LLM API 的智能小工具。
5、数据分析 (Data analysis)
AI 在后台编写并运行 Python 代码,直接对上传的数据集进行处理。
数据清洗: 自动处理缺失值、异常值和格式转换。
统计分析: 计算描述性统计量、运行回归模型、挖掘数据关联。
数据可视化: 自动绘制柱状图、散点图、热力图等,并输出深度分析报告。
整体思维导图如下:

课程地址:
https://www.deeplearning.ai/courses/ai-prompting-for-everyone
夜雨聆风