AI 100 问(零基础 → 深刻认识)

搞懂这 100 个主题 + 300+ 追问,就对 AI 有比较深刻的认识了。 建议节奏:一天 1-2 个主题(含追问),两个月走完。 用法:

  1. 主问题先自己猜一版「我的理解」
  2. 追问链里挑当下最好奇的 1-2 个往深打,别贪多
  3. 把真正学到的压成一两句写在「真实结论」

模板:

- 我的理解:
- 真实结论:
- 日期:

一、数学直觉(不啃公式,只要感觉)

1. 向量是什么?为什么 AI 里一切东西(文字、图像、声音)最后都要变成向量?

追问链:

2. 两个向量"相似"是怎么量化的?点积和余弦相似度的直觉差别在哪?

追问链:

3. 矩阵乘法在几何上到底做了什么?一句话讲清楚

追问链:

4. "高维空间"是什么感觉?人活在 3 维,AI 活在几百上千维,这个"多"带来了什么反直觉的现象?

追问链:

5. 什么是概率分布?为什么正态分布在 AI 里出现得最多?

追问链:

6. 什么是梯度?为什么"沿梯度反方向走一步"就能让模型变聪明一点?

追问链:

7. 损失函数和"错误率"是同一个东西吗?差在哪?

追问链:

8. 什么是过拟合?用"背课本考试作弊"类比讲清楚

追问链:


二、经典 ML(承上启下,别跳过)

9. 机器学习和传统编程最本质的区别是什么?

追问链:

10. 为什么要把数据分成训练集/验证集/测试集三份,不能只用两份?

追问链:

11. 决策树和神经网络最大的思想差别是什么?各自适合什么场景?

追问链:

12. 什么是特征工程?为什么深度学习时代它变得"没那么重要"了?

追问链:

13. 表格类数据上,GBDT(XGBoost/LightGBM)为什么到现在还打不死?

追问链:


三、深度学习基础

14. 一个"神经元"到底在算什么?用最简单的数学式写清楚

追问链:

15. 为什么要加激活函数?全线性(不加)会退化成什么?

追问链:

16. 为什么 ReLU 这么简单粗暴反而比 sigmoid 更好?

追问链:

17. 反向传播"传播"的是什么?用链式法则直觉讲一遍

追问链:

18. 什么是 batch?batch size 调大调小各有什么代价?

追问链:

19. 学习率太大、太小,训练曲线分别长什么样?

追问链:

20. CNN 为什么天然适合图像?它利用了图像的哪两个特性?

追问链:

21. RNN 想解决什么问题?为什么最终被 Transformer 淘汰?

追问链:

22. 什么是梯度消失/爆炸?为什么深网络训起来这么难?

追问链:

23. LayerNorm / BatchNorm 凭什么能让训练变稳?

追问链:


四、Transformer(现代 AI 的引擎,重点)

24. 一句话:Transformer 解决了 RNN 的什么致命痛点?

追问链:

25. 什么是 attention?用"你读这句话时眼睛停在哪"类比

追问链:

26. Self-attention 里的 Q、K、V 分别是什么?为什么要三个而不是一个?

追问链:

27. 为什么要 multi-head?多个头到底各自在看什么?

追问链:

28. 为什么 Transformer 必须加位置编码?不加会退化成什么?

追问链:

29. RoPE(旋转位置编码)比绝对位置编码好在哪?

追问链:

30. 一个 token 进入一层 Transformer 后发生了哪几件事?按顺序讲

追问链:

31. Encoder 和 Decoder 结构差在哪?为什么 GPT 系只留了 decoder?

追问链:

32. 为什么 attention 的复杂度是 O(n²)?这个"²"带来了什么麻烦?

追问链:

33. KV cache 是什么?它省的是哪一步计算?

追问链:

34. FFN(前馈网络)在 Transformer 里起什么作用?

追问链:

35. 为什么研究者说"模型的大部分知识存在 FFN 里"?

追问链:

36. 残差连接(residual)为什么这么重要?去掉会怎样?

追问链:

37. 一个 70B 模型的参数大致分布在哪些层?比例大概多少?

追问链:


五、Tokenization & Embedding

38. 为什么模型不能直接吃文字,要先 tokenize?

追问链:

39. 为什么中文一个字常占 1-2 个 token,英文一个单词可能被切成多段?

追问链:

40. BPE 是怎么工作的?为什么用"字节对编码"而不是按词切?

追问链:

41. Embedding 向量的每一维有明确含义吗?

追问链:

42. "king - man + woman ≈ queen" 这件事为什么曾经震撼了整个领域?

追问链:


六、预训练

43. 什么是自监督学习?为什么它是大模型时代的钥匙?

追问链:

44. LLM 预训练时只在做"预测下一个 token",这件事为什么能学出智能?

追问链:

45. Scaling Laws 说了什么?为什么大家都在堆参数和数据?

追问链:

46. Chinchilla 的"数据量 ≈ 20 × 参数量"这个结论怎么来的?

追问链:

47. 预训练数据都从哪来?Common Crawl 是什么?

追问链:

48. 数据质量 vs 数据数量,哪个更重要?怎么判断?

追问链:

49. 一次万亿参数级别的训练烧多少钱?瓶颈在算力、数据还是工程?

追问链:

50. 从 GPT-2 到 GPT-3 只是变大,为什么能力会"涌现"?

追问链:


七、后训练与对齐

51. 预训练完的模型为什么不能直接用?它会说什么奇怪的话?

追问链:

52. SFT(指令微调)到底教会了模型什么?

追问链:

53. LoRA 为什么能用千分之一的参数达到全量微调的效果?

追问链:

54. RLHF 为什么要用强化学习?不能直接把"好回答"当 SFT 数据吗?

追问链:

55. PPO 在 RLHF 里扮演什么角色?它和奖励模型怎么配合?

追问链:

56. DPO 是怎么绕过奖励模型的?为什么更稳?

追问链:

57. GRPO 做了什么简化让 DeepSeek 能大规模用它?

追问链:

58. Constitutional AI(Anthropic 路线)和 RLHF 最大的区别在哪?

追问链:

59. 什么是"对齐税"?模型被对齐后损失了什么?

追问链:

60. 幻觉是怎么产生的?对齐能彻底消除幻觉吗?

追问链:


八、推理与部署

61. 同一个模型用不同推理框架速度能差 10 倍,差在哪里?

追问链:

62. 量化是什么?INT4 和 FP16 模型在精度、速度、体积上分别差多少?

追问链:

63. 投机解码(speculative decoding)是怎么变快的?

追问链:

64. vLLM 的 PagedAttention 借鉴了操作系统的什么思想?

追问链:

65. 长上下文(100k、1M)是怎么扩出来的?总不是硬扛 O(n²) 吧?

追问链:

66. 为什么"上下文越长,模型越蠢"?中间信息丢失是怎么发生的?

追问链:


九、Prompt 与上下文工程

67. 同一个问题不同 prompt 能差 30% 准确率,背后机制是什么?

追问链:

68. Few-shot 里那几个"例子"对模型做了什么?它是真的在"学"吗?

追问链:

69. Chain-of-Thought 让模型变聪明,是真推理还是"装推理"?

追问链:

70. 结构化输出(JSON / tool schema)是硬约束还是软引导?

追问链:

71. Prompt caching 到底在缓存什么?为什么能省 90% 成本?

追问链:


十、Agent

72. 一个 Agent 和"LLM + while 循环"本质上有区别吗?

追问链:

73. Tool use(function calling)底层怎么实现的?模型真的在"调用"吗?

追问链:

74. ReAct 模式的 Reasoning + Acting 交替在解决什么问题?

追问链:

75. 为什么 multi-agent 不总是比 single-agent 好?

追问链:

76. MCP(Model Context Protocol)在标准化什么?和 OpenAPI 是什么关系?

追问链:

77. Agent 最难的部分是规划、记忆,还是工具调用?

追问链:

78. Agent 跑 30 步后效果崩塌,root cause 通常是哪一类?

追问链:

79. Agent 的 eval 为什么比 LLM 的 eval 难一个数量级?

追问链:


十一、RAG

80. RAG 解决了 LLM 的哪个根本短板?

追问链:

81. 为什么 chunk size 这么关键?过大过小分别坏在哪?

追问链:

82. 向量检索召回的是"相似的",为什么常常不是"相关的"?

追问链:

83. Hybrid search(BM25 + 向量)为什么稳定胜过单一方案?

追问链:

84. RAG 什么时候应该升级成微调?判断标准是什么?

追问链:


十二、多模态

85. CLIP 是怎么把"图"和"文"放进同一个向量空间的?

追问链:

86. 一个 VLM 看图时,图像是怎么变成 token 进到 LLM 里的?

追问链:

87. Whisper 为什么在嘈杂环境下也能工作得好?

追问链:

88. Sora 这类视频生成,本质上在建模什么?

追问链:


十三、生成模型家族

89. Diffusion 的核心思想是"加噪再去噪",为什么这么绕反而效果好?

追问链:

90. 从 DDPM 到 DiT,这一步让 Sora 成为可能——它改了什么?

追问链:

91. GAN 为什么被 Diffusion 打败了?

追问链:

92. 自回归图像生成(VAR)和 Diffusion 是一回事吗?

追问链:


十四、前沿架构

93. MoE(混合专家)为什么能"用一部分参数推理但效果像大模型"?

追问链:

94. Mamba 想取代 Transformer 的哪部分?你判断它会成功吗?

追问链:

95. o1 / R1 这种推理模型和普通 LLM 的本质区别是什么?

追问链:

96. "Test-time compute"为什么被认为是下一个 scaling 方向?

追问链:


十五、评估、安全与大局观

97. MMLU 考 90 分意味着什么?它能代表"智能"吗?

追问链:

98. Prompt injection 为什么这么难防?

追问链:

99. 机制可解释性(mechanistic interpretability)最近发现了什么值得震惊的东西?

追问链:

100. 未来 5 年 AI 最可能的三条路线是什么?你怎么判断自己该押哪条?

追问链: