乐于分享
好东西不私藏

我的 AI 学习周报 - 2026-08-10 ~ 08-16

我的 AI 学习周报 - 2026-08-10 ~ 08-16

······

📝 本周概览

本周是 RAG 从「学习实验」迈向「实战落地」的过渡周,核心成果集中在 08-11 一天:把之前零散的 chunker + retriever 补齐生成环节,搭成完整 RAG 问答系统,并用对照实验得出「小语料上 TF-IDF 完胜 Dense Embedding」的关键结论。

⚠️ 数据缺口: 上周 7 天里仅 08-11 有 daily-log 记录,其余 6 天(08-10、08-12 ~ 08-16)无记录,本周报只能覆盖有记录的部分。

······

🎯 计划 vs 实际

原计划

无周计划基线 —— 这是首次运行 /weekly-report.claude/weekly/data.json 为空。唯一可追溯的「下一步」来自 08-11 日报末尾:

计划项
来源
状态
说明
换强中文 Embedding 模型(BGE-M3 / mE5-large)跑第三组对比
08-11 日报「下一步」
❌ 未做
实现 Hybrid Search(TF-IDF + Dense 多路召回)
08-11 日报「下一步」
❌ 未做

实际做了(有记录部分)

  • 08-11
    :RAG 全链路搭建(chunker → retriever → generator)+ 依赖升级 + 端到端验证 + TF-IDF/Dense 对比实验

······

📐 偏移度分析

完成率: 无法计算 —— 首次运行,无周计划基线

偏移判断: 无法判定(数据不足)

偏移原因:

  1. 无基线可对照(首次周复盘)
  2. 上周 6/7 天无 daily-log 记录,实际工作可能远多于记录

······

🔍 深度评估:需要更深,还是无用做工?

主题
状态
判断
依据
RAG 全链路搭建
✅ 完成
恰到好处
有代码(generator/rag_qa/e2e 测试)、有端到端验证、有性能数据,直接构成后续企业 RAG 的「基础」
TF-IDF vs Dense 对比
✅ 完成
需要更深
得出「小语料 Dense 完败」的反直觉结论,但停在门前:未验证「换强中文模型后是否改观」。而这条结论恰好与本周要攻的 FAQ 层直接相关——FAQ 本质就是小语料匹配问题

······

📋 下周计划(08-17 ~ 08-23)

目标

企业自用 RAG 搭建(核心主线)

现状

  • ✅ 基础已具备:chunker + retriever + generator 完整管线(沿用上周实战成果)
  • 🔴 FAQ 层未搞定,仍在探索中 —— 本周核心攻克点
  • 📌 具体问题:明天补充

里程碑

  • [ ] FAQ 层方案确定并跑通
  • [ ] 企业自用 RAG 端到端可用
  • [ ] (待明天具体问题落地后细化)

······

📊 本周总结

收获: RAG 从半成品实验变成可用的完整系统,并拿到了「小语料 TF-IDF 优先」这个直接指导企业 FAQ 层选型的结论。

调整: 下周把 RAG 从「学习实验」切换到「企业落地」;同时补上 daily-log 的连续记录(上周 6 天断档,复盘缺料)。