乐于分享
好东西不私藏

AI 到底是什么?一份程序员视角的大模型入门指南

AI 到底是什么?一份程序员视角的大模型入门指南

AI零基础 · 第01期

AI 到底是什么?一份程序员视角的大模型入门指南

📅 2026-06-19  |  🏷 AI基础  |  ⏱ 约 7 分钟

如果你是一个 Java 程序员,你可能经常听到这些词:

GPT · 大模型 · 机器学习 · 深度学习 · Transformer · RAG · Agent · Prompt · Token

每个单拿出来都好像懂一点,但连在一起就懵了。

这很正常。因为大多数人学 AI 是被名词轰炸,而不是从一张完整的地图开始。

这一期,我帮你用一个 Java 程序员能理解的方式,把 AI 的完整脉络捋清楚。你需要的不是公式,是一张看得懂的地图。

一、先理清这些名词的关系

很多人分不清 AI、机器学习、深度学习、大模型的关系。其实是一层层包含的:

缩写
全称
通俗解释
AI
Artificial Intelligence
凡是让机器看起来有"智能"的技术都算。Siri 语音助手、推荐算法、AlphaGo 都是 AI
ML
Machine Learning
不写死规则,让机器从数据中学。比如给 10000 张猫狗图,它自己学会区分
DL
Deep Learning
ML 的一个分支,用多层神经网络模拟人脑。现在火的大模型本质就是超大号 DL
LLM
Large Language Model
专门处理语言的超大号深度学习模型。ChatGPT 背后就是 LLM
GPT
Generative Pre-trained Transformer
OpenAI 做的一个具体 LLM 品牌。ChatGPT 是 GPT 的聊天版本
💡 Java 程序员的类比:
AI = 「编程语言」总称
ML = 「面向对象编程」一种范式
DL = 「Java 的 Spring 框架」具体实现
LLM = 「Spring Boot」最佳实践
—— 这样是不是好理解了?

二、大模型到底是怎么"思考"的?

抛开数学公式,大模型的工作流程就四个字:猜下一个字。对,你没听错——它本质上就是在"猜"。GPT 的全称里 Generative Pre-trained,指的就是"生成式"。

简化版工作流程

关键洞察:大模型没有"理解"语言,它只是在做超高级的"字接龙"。但因为训练的语料足够大(几万亿字),参数足够多(GPT-4 预估 1.8 万亿),它接龙出来的结果对得离谱。

几个关键概念,一张表说清楚

概念
通俗解释
Java 类比
Token
文字的最小处理单元。一个汉字 ≈ 2 Token,一个英文单词 ≈ 1.3 Token
类比 char 和 String 的关系
Embedding
把词语变成一串数字向量,让计算机能"算"语义
把 String "猫" 映射到 double[768]
Transformer
大模型的核心算法架构,2017 年 Google 提出
类比 Spring MVC 的 DispatcherServlet
注意力机制
让模型知道一句话里哪些词更重要
像 IDE 里 Ctrl+Click 跳转到关键类
预训练
用海量数据提前训练好模型,你直接拿来用
类比引入 Maven 依赖,不用自己写

三、大模型能做什么?对程序员有什么用?

别以为大模型只能聊天。它的能力矩阵远超你想象:

能力
说明
程序员场景
代码生成
根据描述写代码
Copilot、Cursor 这类工具
自然语言理解
读文档、总结内容
帮你读 RFC 规范并总结要点
翻译
代码 ↔ 中文
把一段 SQL 翻译成人话
推理
逻辑分析、数学
分析时间复杂度、找最优算法
多模态
处理图片、音频
根据 UI 截图生成前端代码
RAG
检索增强生成
把你的项目文档喂进去,AI 回答更准
Agent
自主决策执行
AI 自动帮你建项目、写 CI 脚本

四、Java 程序员学 AI 的路径

别被"学 AI"吓到。你不是要转行做算法工程师,你是要学会用 AI 武装自己。这两条路完全不同:

角色
需要学什么
投入时间
AI 应用开发者
(推荐)
Prompt 工程、调用 API、RAG、Agent 搭建
2-4 周上手
AI 算法工程师
数学、深度学习框架、模型训练、微调
6-12 个月

你的目标是第一种。就像你不需要会造 Spring 框架才能用 Spring 写项目一样,你不需要会训练大模型才能用 AI 提升效率。

这个《AI零基础》系列就是按"应用开发者"路线设计的。后续我们会逐步讲:

Prompt 怎么写才高效

如何用 Java 调用 OpenAI / 文心 API

本地跑一个开源模型(Ollama)

RAG:给你的项目文档装上 AI 问答

Agent:让 AI 自己干活

五、动手试一下:5 分钟本地跑一个 AI

读完这么多理论,你肯定手痒了。来,用Ollama在你的电脑上跑一个开源大模型:

1安装 Ollama

ollama.com下载安装包。Windows/Mac/Linux 全支持,安装过程就是一路 Next。

2下载一个模型

打开终端,输入:

# 下载 qwen2.5 7B 模型(约 4.5GB)ollama pull qwen2.5:7b

等几分钟下载完。

3开始对话

# 直接输入问题:ollama run qwen2.5:7b>>> 用 Java 写一个二分查找

它就会在本地给你生成代码——完全离线,不花一分钱,不怕数据泄露

⚠️ 注意:7B 模型需要 8GB 以上内存。如果你的电脑配置低,换qwen2.5:1.5b(约 1GB),效果差点但能跑。

六、一句话总结

✅ 大模型 = 超高级的"字接龙"。
它的核心能力是 Token → Embedding → Transformer → 预测下一个词。
作为 Java 程序员,你需要的不是训练模型,而是学会用 AI 武装自己。
这个系列会带你从 Prompt 到 RAG 到 Agent,一步步来。
📌 下周四预告:Prompt Engineering 入门——同样是问 AI,为什么别人得到的答案比你准 10 倍?学会这 5 个万能 Prompt 模板,AI 的回答立刻不一样。

📱 关注「从CRUD到架构师」,每周五天陪你成长

周一 Java 基础 · 周二 AI 实战 · 周三 架构底层 · 周四 AI 入门 · 周五 面试宝典

后台回复「AI入门」获取本期思维导图 + Ollama 安装指南 PDF

「从CRUD到架构师」· 每周一三五 Java,二四 AI · 陪你从 CRUD 到架构师