乐于分享
好东西不私藏

AI学习路径完全解析(一)职业学习路径篇

AI学习路径完全解析(一)职业学习路径篇
废话不多说,直接进入主题。
目前AI的学习路径一直处于零散状态,并未有完整的职业或技能路径呈现出来,本文根据国内外的自学研究,为大家分享并结构化AI的学习路径。本人也正在学习中,会实时更新和完善
本文结构如下:
AI的学习路径
职业学习路径(本次分享)
技能学习路径(下次分享)
职业学习路径:
A. 数据分析师
1. SQL数据分析师:
掌握查询数据库、分析结果并成为精通 SQL 的数据分析师所需的 SQL 技能。
涉及数据分析、数据处理、函数、统计学、数据可视化等。
2. Python数据分析师:
Python 数据分析技能。 掌握数据分析师技能,能够处理、分析和可视化数据。
涉及pandas数据处理、统计、可视化、Python抽样、Python假设检验等
3. R数据分析师:
使用 dplyr 进行探索性数据分析到使用 ggplot2 进行数据可视化。
涉及Tidyverse、dplyr数据处理和表连接、统计学、可视化、抽样、假设检验等
4. Databricks数据分析师:
Databricks、SQL、数据可视化和 Lakehouse Platform 管理。
涉及数据工程、数据管理等
B. BI分析师(常用的)
1. Power BI 分析师:
建模和可视化数据所需的 Power BI 技能。
涉及DAX、数据可视化、数据准备、数据转换、数据建模等

2. Tableau 分析师:

掌握 Tableau 进行数据分析。

C. 数据工程师
1. SQL数据工程师:
学习数据工程基础:数据库设计和数据仓库,并掌握包括 PostgreSQL 和 Snowflake 在内的技术。
2. Python数据工程师
掌握高需求技能,高效摄取、清洗、管理数据,并调度和监控管道;了解现代数据架构的关键组件,从摄取和服务到治理与编排。
涉及云计算、shell、容器化与虚拟化、dbt、NoSQL、DevOps、Docker、PySpark、RDD、Streaming、Kafka、Kubernetes等
3. Databricks数据工程师:
通过 SQL、Python 和 Spark 在 Databricks 上学习数据工程,并为 Databricks Certified Data Engineer Associate的能力做储备。
涉及Databricks SQL、Python、Git、Lakehouse、PySpark、Spark SQL等
4. Snowflake数据工程师:
学习在 Snowflake 中进行设计、查询和构建,掌握用于转换和建模的 Snowflake SQL,成为具备就业能力的数据工程师。
5. Java数据工程师:
培养数据工程所需的核心 Java 技能,从文件处理和数据库集成到性能优化。
D. 数据科学家
1. Python数据科学家:
学习 Python 中的数据科学,从数据处理到机器学习。 此路径提供成为数据科学家所需的基础技能。
  • 涉及pandas数据连接与处理;
  • Python统计学;
  • Matplotlib数据可视化;
  • Seaborn数据可视化;
  • 数据清洗、抽样;
  • 假设检验、实验设计;
  • scikit-learn监督学习;
  • 无监督学习;
  • 树模型机器学习;
  • Git等。
2. R数据科学家:
学习如何使用 R 进行数据科学,从数据处理到机器学习。
  • 涉及Tidyverse;
  • dplyr;
  • R统计学;
  • ggplot2可视化;
  • 数据清洗;
  • 探索性数据分析;
  • 回归、抽样、统计学;
  • 无监督学习;
  • 面向业务的机器学习;
  • 特征工程;
  • Git等。
E. 机器学习科学家
1. Python的机器学习科学家:
使用 Python 探索机器学习,并朝着成为机器学习科学家的目标迈进。 探索监督学习、无监督学习和深度学习。
  • 涉及使用scikit-learn的监督学习;
  • 无监督学习;
  • 线性分类;
  • 树模型机器学习;
  • 使用XGBoost的极端梯度提升;
  • 聚类分析、降维;
  • 机器学习预处理;
  • 时间序列机器学习;
  • 机器学习特征工程;
  • 模型验证;
  • 超参数调优;
  • 自然语言处理、自然语言处理特征工程;
  • 图像处理;
  • PySpark及机器学习等。
2. R的机器学习科学家:
研究新的方法并构建机器学习模型。
  • 涉及监督学习(分类、回归);
  • 特征工程;
  • 无监督学习;
  • Tidyverse的机器学习;
  • 中级回归;
  • 聚类分析;
  • 使用caret的机器学习;
  • 使用tidymodels建模;
  • 树模型机器学习;
  • 支持向量机、降维;
  • 贝叶斯数据分析;
  • 超参数调优;
  • 使用rstanarm进行贝叶斯回归建模;
  • 使用sparklyr等。
F. 机器学习工程师
掌握机器学习工程和 MLOps 所需的一切知识。
  • 涉及使用scikit-learn的监督学习;
  • MLOps概念;
  • MLOps部署及生命周期管理;
  • shell入门;
  • MLflow;
  • 使用Python 的 ETL 和 ELT;
  • 用 Python 的 Great Expectations 库确保数据科学和数据工程工作流中的高数据质量;
  • DVC数据版本管理;
  • 机器学习监控(了解在生产环境中监控机器学习模型的挑战,包括数据漂移和概念漂移,以及应对模型退化的方法);
  • 在 Python 中构建基础机器学习监控系统所需的一切知识;
  • 了解 Docker 入门;
  • 掌握它在数据专业人士工具箱中的重要性;
  • 用 GitHub Actions 和 Data Version Control 通过 CI/CD 提升你的机器学习开发。
G. AI工程师(下面以Open AI为例)
1. 面向开发者的AI工程师:
了解如何使用 API 和开源库将 AI 集成到软件应用程序中。
  • 涉及API的使用;
  • 浏览并使用 Hugging Face Hub 上丰富的模型和数据集资源;
  • 了解 LLMOps 从构想到部署,掌握其生命周期与挑战,并学会将这些概念应用到应用中;
  • 借助 OpenAI Responses API 和 GPT-5,构建智能、交互式且可靠的 AI 应用;
  • 用 OpenAI 的嵌入模型解锁更高级的 AI 应用,如语义搜索;
  • 了解 Pinecone 向量数据库构建AI应用;
  • 了解模块化、文档和自动化测试即Python的软件工程原理;
  • 了解如何使用 LLM、提示、链和代理在 LangChain 中构建 AI 驱动的应用程序。
2. 面向数据科学家的AI工程师:
  • 训练并微调最新的 AI 模型以用于生产环境,包括像 Llama 3 这样的 LLM;
  • 用 Python 中的 scikit-learn 提升你的机器学习技能、学习如何使用 scikit-learn 和 scipy 对无标签数据集进行聚类、转换、可视化并提取洞察;
  • 浏览并使用 Hugging Face Hub 上丰富的模型和数据集资源;
  • 学习如何在 PyTorch 中构建你的第一个神经网络、调整超参数,并解决分类和回归问题;
  • 掌握使用 Scikit-learn、SHAP 和 LIME 测试并构建透明、可信且可问责的 AI 系统的核心技能;
  • 了解用于建模图像和序列数据的基础深度学习架构,如 CNN、RNN、LSTM 和 GRU;
  • 掌握LLM的核心原理及其所基于的革命性Transformer架构;
  • 探索在本地运行 Llama LLM 并将其集成到你的技术栈中的最新技术;
  • 了解 MLOps 如何将机器学习模型从本地实验带到生产环境中运行,并创造实际业务价值;
  • 了解模块化、文档和自动化测试即Python的软件工程原理;掌握 Git 基础,管理软件和数据项目的版本控制;
  • 掌握 Python 测试: 掌握方法、创建检查,并使用 pytest 和 unittest 确保代码无错误。

H. 统计学家
通过R收集和分析数据,帮助公司理解定量数据,包括发现趋势和进行预测。
  • 涉及R统计学;
  • 随机变量、分布和条件化的概念;
  • 用 R 实现、分析并解读回归分析;学习使用多个解释变量进行线性回归和逻辑回归;
  • 掌握抽样,用更少的数据获得更准确的统计结果;
  • 了解如何以及何时在 R 中使用假设检验,包括 t 检验、比例检验和卡方检验;
  • 学习基础实验设计,这是任何数据分析的关键组成部分;
  • 学习调查设计,掌握常见设计结构,并可视化和分析调查结果;
  • 学习在R中如何拟合带随机效应的层级模型;
  • 学习处理时间到事件数据;
  • 了解贝叶斯数据分析是什么、如何运作,以及为何它是数据科学工具箱中的实用工具;
  • 用探索性和验证性因子分析探索潜变量;
  • 学习如何通过称为统计推断的过程,根据样本数据对总体得出结论。

    【欢迎扫码关注与加入】