AI 100 问(零基础 → 深刻认识)
搞懂这 100 个主题 + 300+ 追问,就对 AI 有比较深刻的认识了。 建议节奏:一天 1-2 个主题(含追问),两个月走完。 用法:
- 主问题先自己猜一版「我的理解」
- 追问链里挑当下最好奇的 1-2 个往深打,别贪多
- 把真正学到的压成一两句写在「真实结论」
模板:
- 我的理解: - 真实结论: - 日期:
一、数学直觉(不啃公式,只要感觉)
1. 向量是什么?为什么 AI 里一切东西(文字、图像、声音)最后都要变成向量?
追问链:
-
一个 768 维的 float32 向量在内存里占多少字节?
-
为什么用稠密向量而不是 one-hot 稀疏表示?
-
把维度从 768 压到 128 会损失什么?
-
为什么文字、图像、声音能用"同一种东西"表示?
-
我的理解:
-
真实结论:
-
日期:
2. 两个向量"相似"是怎么量化的?点积和余弦相似度的直觉差别在哪?
追问链:
-
欧氏距离、点积、余弦相似度三者什么时候结果不一致?
-
为什么检索时大家更爱用余弦相似度?
-
归一化后的点积和余弦相似度是一回事吗?
-
向量的"方向"和"大小"分别承载什么信息?
-
我的理解:
-
真实结论:
-
日期:
3. 矩阵乘法在几何上到底做了什么?一句话讲清楚
追问链:
-
线性变换可以分解成哪几种基本变换(旋转/缩放/剪切)?
-
为什么神经网络的一层本质上就是"矩阵乘 + 非线性"?
-
为什么 GPU 特别擅长矩阵乘法?
-
AB ≠ BA 在深度学习里意味着什么?
-
我的理解:
-
真实结论:
-
日期:
4. "高维空间"是什么感觉?人活在 3 维,AI 活在几百上千维,这个"多"带来了什么反直觉的现象?
追问链:
-
什么是维度诅咒?
-
为什么"高维空间里随机两点几乎总是正交"?
-
为什么 LLM 能在几千维空间里塞下整个人类知识?
-
"语义靠得近"在高维里的实际表现是什么?
-
我的理解:
-
真实结论:
-
日期:
5. 什么是概率分布?为什么正态分布在 AI 里出现得最多?
追问链:
-
均匀/正态/指数分布各在 AI 哪些地方出现?
-
中心极限定理为什么"逼出"正态分布的统治地位?
-
softmax 输出的是分布还是概率?
-
为什么模型初始化用正态分布?
-
我的理解:
-
真实结论:
-
日期:
6. 什么是梯度?为什么"沿梯度反方向走一步"就能让模型变聪明一点?
追问链:
-
梯度是向量还是标量?方向是什么?
-
为什么叫"梯度下降"而不是"梯度上升"?
-
学习率在更新公式里扮演什么角色?
-
离散问题(选工具/选 token)没有梯度怎么办?
-
我的理解:
-
真实结论:
-
日期:
7. 损失函数和"错误率"是同一个东西吗?差在哪?
追问链:
-
为什么训练用 cross-entropy 而不是直接用准确率?
-
为什么损失函数必须可微?
-
分类和回归为什么用不同的损失?
-
多目标任务怎么设计损失?
-
我的理解:
-
真实结论:
-
日期:
8. 什么是过拟合?用"背课本考试作弊"类比讲清楚
追问链:
-
欠拟合和过拟合怎么从 loss 曲线上看出来?
-
正则化(L1/L2/Dropout)是怎么抑制过拟合的?
-
为什么"大模型反而不容易过拟合"?
-
过拟合和记忆(memorization)是一回事吗?
-
我的理解:
-
真实结论:
-
日期:
二、经典 ML(承上启下,别跳过)
9. 机器学习和传统编程最本质的区别是什么?
追问链:
-
传统编程写规则,ML "学"规则——"学"的过程是什么?
-
为什么说 ML 是"可编程的统计学"?
-
什么时候该用 ML,什么时候硬写 if-else 更好?
-
一个 ML 系统 vs 传统程序,输入输出边界差在哪?
-
我的理解:
-
真实结论:
-
日期:
10. 为什么要把数据分成训练集/验证集/测试集三份,不能只用两份?
追问链:
-
只用训练 + 测试会出什么问题?
-
验证集用来调什么,测试集用来做什么?
-
k-fold 交叉验证解决了什么问题?
-
数据分布漂移(train vs prod 不一致)怎么检测?
-
我的理解:
-
真实结论:
-
日期:
11. 决策树和神经网络最大的思想差别是什么?各自适合什么场景?
追问链:
-
决策树的"可解释"是真的可解释吗?
-
为什么图像用神经网络,表格用树模型?
-
XGBoost 和单棵决策树是什么关系?
-
神经网络能不能"编译"成决策树?
-
我的理解:
-
真实结论:
-
日期:
12. 什么是特征工程?为什么深度学习时代它变得"没那么重要"了?
追问链:
-
深度学习"消灭"特征工程其实把它挪到了哪里?
-
LLM 时代的特征工程等价物是什么?
-
为什么时序/点击流的特征工程还活着?
-
好特征的三个标准是什么?
-
我的理解:
-
真实结论:
-
日期:
13. 表格类数据上,GBDT(XGBoost/LightGBM)为什么到现在还打不死?
追问链:
-
为什么神经网络在表格上打不过树模型?
-
TabNet / FT-Transformer 这类方案差在哪?
-
树模型学得到而神经网络学不到的是什么?
-
AutoML 为什么还没完全替代手工特征?
-
我的理解:
-
真实结论:
-
日期:
三、深度学习基础
14. 一个"神经元"到底在算什么?用最简单的数学式写清楚
追问链:
-
y = w·x + b 这个式子最多能表示什么函数?
-
多个神经元叠加为什么能表示任意函数(万能近似定理)?
-
为什么每个神经元有 bias 项?没了会怎样?
-
"宽度"和"深度"哪个更重要?
-
我的理解:
-
真实结论:
-
日期:
15. 为什么要加激活函数?全线性(不加)会退化成什么?
追问链:
-
不加激活,10 层网络等价于几层?
-
sigmoid、tanh、ReLU、GELU 各自的优劣?
-
为什么 LLM 现在普遍用 SwiGLU?
-
激活函数影响表达能力还是只影响优化?
-
我的理解:
-
真实结论:
-
日期:
16. 为什么 ReLU 这么简单粗暴反而比 sigmoid 更好?
追问链:
-
sigmoid 的梯度消失是怎么来的?
-
"dying ReLU"是什么?怎么缓解?
-
为什么 ReLU 在浅层网络反而不如 sigmoid 稳?
-
Leaky ReLU / GELU 在修什么?
-
我的理解:
-
真实结论:
-
日期:
17. 反向传播"传播"的是什么?用链式法则直觉讲一遍
追问链:
-
没有反向传播,神经网络还能训吗(进化算法/forward-forward)?
-
为什么反向传播的计算代价约等于前向?
-
计算图(computation graph)扮演什么角色?
-
autodiff 和反向传播是一回事吗?
-
我的理解:
-
真实结论:
-
日期:
18. 什么是 batch?batch size 调大调小各有什么代价?
追问链:
-
batch=1 和 batch=全量是两种什么极端?
-
为什么大 batch 有时候效果反而差?
-
gradient accumulation 怎么"模拟"大 batch?
-
batch size 和学习率应该怎么联动?
-
我的理解:
-
真实结论:
-
日期:
19. 学习率太大、太小,训练曲线分别长什么样?
追问链:
-
warmup 在解决什么问题?
-
cosine schedule 为什么这么流行?
-
lr-find 怎么找最优初值?
-
Adam 和 SGD 对学习率敏感度为什么差那么多?
-
我的理解:
-
真实结论:
-
日期:
20. CNN 为什么天然适合图像?它利用了图像的哪两个特性?
追问链:
-
卷积核(kernel)在做什么?
-
为什么池化能降维还不丢主要信息?
-
ResNet 解决了什么问题让 CNN 能训 1000 层?
-
ViT 为什么能打败 CNN?
-
我的理解:
-
真实结论:
-
日期:
21. RNN 想解决什么问题?为什么最终被 Transformer 淘汰?
追问链:
-
RNN 的"记忆"是怎么实现的?
-
LSTM 的三个门分别干什么?
-
RNN 训得慢的根源是什么?
-
为什么说 RNN 理论上能无限长,实际却不如 Transformer?
-
我的理解:
-
真实结论:
-
日期:
22. 什么是梯度消失/爆炸?为什么深网络训起来这么难?
追问链:
-
为什么层数越深越容易消失/爆炸?
-
梯度裁剪治标还是治本?
-
正交初始化 vs He 初始化怎么帮助?
-
残差连接为什么能"直通"梯度?
-
我的理解:
-
真实结论:
-
日期:
23. LayerNorm / BatchNorm 凭什么能让训练变稳?
追问链:
-
LayerNorm 和 BatchNorm 作用维度有什么区别?
-
为什么 Transformer 用 LayerNorm 不用 BatchNorm?
-
RMSNorm 怎么比 LayerNorm 更快?
-
pre-norm 和 post-norm 架构差在哪?
-
我的理解:
-
真实结论:
-
日期:
四、Transformer(现代 AI 的引擎,重点)
24. 一句话:Transformer 解决了 RNN 的什么致命痛点?
追问链:
-
RNN 的"顺序依赖"为什么阻碍 GPU 并行?
-
Transformer 并行上赢了,在什么场景反而输?
-
为什么没有"LSTM + attention"成为主流?
-
Transformer 是必然胜利还是"时代选对"?
-
我的理解:
-
真实结论:
-
日期:
25. 什么是 attention?用"你读这句话时眼睛停在哪"类比
追问链:
-
attention weight 的 softmax 为什么让注意力"稀疏"?
-
为什么注意力必须归一化(加起来 = 1)?
-
注意力是"硬选"还是"软加权"?
-
一个 token 对另一个 token 的注意力能为负吗?
-
我的理解:
-
真实结论:
-
日期:
26. Self-attention 里的 Q、K、V 分别是什么?为什么要三个而不是一个?
追问链:
-
为什么要把 embedding 投影成 Q、K、V?
-
K 和 Q 共享参数会怎样?
-
"Q 和 K 的点积"到底代表什么语义?
-
V 为什么承担"实际传递的信息"这个角色?
-
我的理解:
-
真实结论:
-
日期:
27. 为什么要 multi-head?多个头到底各自在看什么?
追问链:
-
不同 head 真的学到不同模式了吗(有证据吗)?
-
head 数量越多越好吗?到多少饱和?
-
剪掉一半 head 对效果影响多大?
-
Grouped-Query Attention (GQA) 在省什么?
-
我的理解:
-
真实结论:
-
日期:
28. 为什么 Transformer 必须加位置编码?不加会退化成什么?
追问链:
-
没有位置编码,Transformer 会把句子当什么(词袋?)?
-
正弦位置编码为什么用 sin/cos?
-
绝对位置编码外推(输入比训练长)会崩在哪?
-
为什么位置信息加到 embedding 而不是单独一路?
-
我的理解:
-
真实结论:
-
日期:
29. RoPE(旋转位置编码)比绝对位置编码好在哪?
追问链:
-
RoPE 把位置信息注入到哪一步?
-
为什么 RoPE 对长度外推更友好?
-
RoPE 的"旋转角"和位置是怎么对应的?
-
YaRN / NTK-aware scaling 怎么基于 RoPE 扩长度?
-
我的理解:
-
真实结论:
-
日期:
30. 一个 token 进入一层 Transformer 后发生了哪几件事?按顺序讲
追问链:
-
正确的顺序是 norm→attn→residual→norm→FFN→residual 吗?
-
pre-norm 和 post-norm 顺序差别影响什么?
-
每层都有 attn + FFN,它们的作用可以互换吗?
-
一层 Transformer 的参数量怎么估?
-
我的理解:
-
真实结论:
-
日期:
31. Encoder 和 Decoder 结构差在哪?为什么 GPT 系只留了 decoder?
追问链:
-
BERT 的 MLM 为什么用 encoder?
-
causal mask 是怎么让 decoder-only 能做生成的?
-
T5 为什么保留了 encoder-decoder?
-
为什么现在往 decoder-only 统一收敛?
-
我的理解:
-
真实结论:
-
日期:
32. 为什么 attention 的复杂度是 O(n²)?这个"²"带来了什么麻烦?
追问链:
-
O(n²) 来自 attention 的哪一步?
-
100k token 和 1k token 计算量差多少倍?
-
FlashAttention 改了算法复杂度还是常数?
-
Linear attention 把 O(n²) 降到 O(n),代价是什么?
-
我的理解:
-
真实结论:
-
日期:
33. KV cache 是什么?它省的是哪一步计算?
追问链:
-
没有 KV cache,每生成一个 token 要重算多少?
-
KV cache 显存占用和什么成正比?
-
KV cache 压缩(MLA/MQA/GQA)是怎么做的?
-
KV cache 能跨请求复用吗(prompt caching)?
-
我的理解:
-
真实结论:
-
日期:
34. FFN(前馈网络)在 Transformer 里起什么作用?
追问链:
-
FFN 的 up-proj 和 down-proj 分别做什么?
-
为什么 FFN 中间维度通常是 4 × hidden?
-
SwiGLU 比普通 FFN 好在哪?
-
没有 FFN 只有 attention 的 Transformer 会怎样?
-
我的理解:
-
真实结论:
-
日期:
35. 为什么研究者说"模型的大部分知识存在 FFN 里"?
追问链:
-
这个结论是怎么通过实验证实的?
-
"知识神经元"(knowledge neurons)是什么?
-
模型编辑(model editing)是怎么基于这个结论做的?
-
如果 FFN 存知识,attention 存什么?
-
我的理解:
-
真实结论:
-
日期:
36. 残差连接(residual)为什么这么重要?去掉会怎样?
追问链:
-
残差让训练变稳的直觉解释?
-
"residual stream"这个概念指什么?
-
为什么有"iterative refinement"的说法?
-
去掉残差后能训多深的网络?
-
我的理解:
-
真实结论:
-
日期:
37. 一个 70B 模型的参数大致分布在哪些层?比例大概多少?
追问链:
-
attention 参数 vs FFN 参数比例大概是?
-
embedding + lm_head 占多少?
-
如果只能剪 10% 参数,该剪哪里?
-
参数量和激活显存的关系?
-
我的理解:
-
真实结论:
-
日期:
五、Tokenization & Embedding
38. 为什么模型不能直接吃文字,要先 tokenize?
追问链:
-
tokenize 是"分词"还是"编码"?
-
为什么不用字符级输入?
-
vocab size 选 5 万、10 万、20 万各有什么取舍?
-
tokenizer 训练数据偏了对模型有什么影响?
-
我的理解:
-
真实结论:
-
日期:
39. 为什么中文一个字常占 1-2 个 token,英文一个单词可能被切成多段?
追问链:
-
同一段内容中文 token 数为什么比英文多?
-
这对中文用户意味着什么(成本、上下文)?
-
Qwen 怎么做"中文友好"的 tokenizer?
-
tokenize emoji、代码、数字各有什么坑?
-
我的理解:
-
真实结论:
-
日期:
40. BPE 是怎么工作的?为什么用"字节对编码"而不是按词切?
追问链:
-
BPE 算法的合并规则是什么?
-
字节级 BPE 为什么能处理任何 Unicode?
-
SentencePiece / Unigram 和 BPE 差在哪?
-
tiktoken 为什么这么快?
-
我的理解:
-
真实结论:
-
日期:
41. Embedding 向量的每一维有明确含义吗?
追问链:
-
单维度有含义,还是多维度的线性组合有?
-
怎么做 probing 验证某个方向对应"情感/时态"?
-
为什么 embedding 空间是"特征的叠加"?
-
superposition hypothesis 是什么?
-
我的理解:
-
真实结论:
-
日期:
42. "king - man + woman ≈ queen" 这件事为什么曾经震撼了整个领域?
追问链:
-
这种类比关系在现代 LLM 的 embedding 里还成立吗?
-
为什么"线性结构"会自发涌现?
-
它暗示了知识怎么在模型里组织?
-
对可解释性研究有什么影响?
-
我的理解:
-
真实结论:
-
日期:
六、预训练
43. 什么是自监督学习?为什么它是大模型时代的钥匙?
追问链:
-
自监督、监督、无监督边界在哪?
-
为什么"预测下一个 token"算自监督?
-
它怎么解决了数据标注瓶颈?
-
还有哪些自监督形式(MLM/对比学习/diffusion)?
-
我的理解:
-
真实结论:
-
日期:
44. LLM 预训练时只在做"预测下一个 token",这件事为什么能学出智能?
追问链:
-
为什么这个简单目标能学出语法、知识、推理?
-
"完形填空"和"预测下一个"在能力上差别?
-
智能是"被逼出来"的副产品还是目标?
-
暗示未来还有什么目标函数能榨出新能力?
-
我的理解:
-
真实结论:
-
日期:
45. Scaling Laws 说了什么?为什么大家都在堆参数和数据?
追问链:
-
scaling laws 具体预测什么曲线?
-
为什么是幂律而不是指数?
-
scaling 瓶颈最终在哪(算力/数据/架构)?
-
有哪些已知的"scaling 失效"场景?
-
我的理解:
-
真实结论:
-
日期:
46. Chinchilla 的"数据量 ≈ 20 × 参数量"这个结论怎么来的?
追问链:
-
1:20 比例是怎么推导的?
-
为什么在这之前大家都训得"过参数"?
-
DeepSeek 和 Llama 实际比例接近 1:20 吗?
-
这个结论在 MoE 上还成立吗?
-
我的理解:
-
真实结论:
-
日期:
47. 预训练数据都从哪来?Common Crawl 是什么?
追问链:
-
Common Crawl 一共多大?
-
预训练数据去重、过滤的常见流水线?
-
中文数据占比、质量如何?
-
法律上用这些数据训练合规吗?
-
我的理解:
-
真实结论:
-
日期:
48. 数据质量 vs 数据数量,哪个更重要?怎么判断?
追问链:
-
高质量数据有哪些可测量指标?
-
合成数据(synthetic data)现在占比多少?
-
"数据墙"这个说法是真的吗?
-
phi 系列用"教科书质量"证明了什么?
-
我的理解:
-
真实结论:
-
日期:
49. 一次万亿参数级别的训练烧多少钱?瓶颈在算力、数据还是工程?
追问链:
-
70B 训练的 GPU-hour 大概多少?
-
为什么电费可能超过卡租金?
-
checkpoint 挂了代价多大?
-
数据中心网络带宽为什么是瓶颈?
-
我的理解:
-
真实结论:
-
日期:
50. 从 GPT-2 到 GPT-3 只是变大,为什么能力会"涌现"?
追问链:
-
哪些能力被证实"涌现"(多位数乘法、CoT)?
-
涌现是真的突变还是度量问题?
-
"grokking"现象和涌现是一回事吗?
-
小模型能复现大模型的涌现能力吗?
-
我的理解:
-
真实结论:
-
日期:
七、后训练与对齐
51. 预训练完的模型为什么不能直接用?它会说什么奇怪的话?
追问链:
-
base model 直接问"你好"会回什么?
-
为什么 base model 擅长续写但不擅长对话?
-
base model 其实是什么(一个模拟器?)?
-
base 和 chat 的价值分别在哪?
-
我的理解:
-
真实结论:
-
日期:
52. SFT(指令微调)到底教会了模型什么?
追问链:
-
SFT 数据集通常多大?
-
一个好的 SFT 样本长什么样?
-
SFT 会让模型变"蠢"吗(对齐税)?
-
self-instruct 怎么用模型自己生成 SFT 数据?
-
我的理解:
-
真实结论:
-
日期:
53. LoRA 为什么能用千分之一的参数达到全量微调的效果?
追问链:
-
LoRA 为什么选"低秩"这个假设?
-
rank 选 8、16、64 各有什么取舍?
-
QLoRA 量化的是哪部分?
-
LoRA 适配器能动态加载/切换吗?
-
我的理解:
-
真实结论:
-
日期:
54. RLHF 为什么要用强化学习?不能直接把"好回答"当 SFT 数据吗?
追问链:
-
好回答当 SFT 数据会遇到什么问题?
-
RL 在解决"没有标准答案"的什么困境?
-
负样本(坏回答)的信息为什么 SFT 用不了?
-
为什么叫"reinforcement"而不是"supervised"?
-
我的理解:
-
真实结论:
-
日期:
55. PPO 在 RLHF 里扮演什么角色?它和奖励模型怎么配合?
追问链:
-
奖励模型输出的是 score 还是 ranking?
-
PPO 里的 KL 惩罚项在防什么?
-
PPO 不稳定的根源?
-
reference model 在 PPO 里干什么?
-
我的理解:
-
真实结论:
-
日期:
56. DPO 是怎么绕过奖励模型的?为什么更稳?
追问链:
-
DPO 的核心公式绕过了哪一步?
-
为什么 DPO 更稳?
-
DPO 数据必须是"pairs"吗?
-
什么场景 DPO 反而不如 PPO?
-
我的理解:
-
真实结论:
-
日期:
57. GRPO 做了什么简化让 DeepSeek 能大规模用它?
追问链:
-
GRPO 去掉了 PPO 的什么组件?
-
它怎么用 group 统计量估 baseline?
-
DeepSeek-R1 是不是全靠 GRPO?
-
GRPO 适合所有任务吗?
-
我的理解:
-
真实结论:
-
日期:
58. Constitutional AI(Anthropic 路线)和 RLHF 最大的区别在哪?
追问链:
-
"宪法"在这里指什么?
-
AI feedback vs human feedback 的优势?
-
这条路径的风险在哪?
-
Anthropic 为什么押注 CAI?
-
我的理解:
-
真实结论:
-
日期:
59. 什么是"对齐税"?模型被对齐后损失了什么?
追问链:
-
对齐后 MMLU 分数通常掉多少?
-
哪类能力最容易被对齐伤到?
-
base vs aligned 的取舍怎么权衡?
-
"un-aligned 版本"能恢复能力吗?
-
我的理解:
-
真实结论:
-
日期:
60. 幻觉是怎么产生的?对齐能彻底消除幻觉吗?
追问链:
-
幻觉的几种类型(事实性/虚构引用/逻辑漂移)?
-
RAG 是彻底解决幻觉还是缓解?
-
为什么模型"知道自己不知道"很难?
-
幻觉率能定量测吗?
-
我的理解:
-
真实结论:
-
日期:
八、推理与部署
61. 同一个模型用不同推理框架速度能差 10 倍,差在哪里?
追问链:
-
vLLM / TGI / llama.cpp / SGLang 各自定位?
-
连续批处理(continuous batching)是什么?
-
为什么朴素 HuggingFace 推理慢?
-
延迟 vs 吞吐量怎么权衡?
-
我的理解:
-
真实结论:
-
日期:
62. 量化是什么?INT4 和 FP16 模型在精度、速度、体积上分别差多少?
追问链:
-
INT4 怎么保留精度?
-
GPTQ vs AWQ 差在哪?
-
为什么有人说"8bit 几乎无损、4bit 有损"?
-
激活量化 vs 权重量化分别影响什么?
-
我的理解:
-
真实结论:
-
日期:
63. 投机解码(speculative decoding)是怎么变快的?
追问链:
-
"草稿模型"怎么选?
-
接受率太低会不会反而变慢?
-
Medusa / Eagle 和传统投机解码差在哪?
-
为什么计算总量没减少还能快?
-
我的理解:
-
真实结论:
-
日期:
64. vLLM 的 PagedAttention 借鉴了操作系统的什么思想?
追问链:
-
KV cache 的内存碎片问题怎么来的?
-
PagedAttention 对并发吞吐提升多少?
-
prefix sharing 怎么借助这个机制?
-
这套思路还能迁移到哪里?
-
我的理解:
-
真实结论:
-
日期:
65. 长上下文(100k、1M)是怎么扩出来的?总不是硬扛 O(n²) 吧?
追问链:
-
RoPE scaling、NTK-aware、YaRN 各解决什么?
-
sliding window attention 的取舍?
-
linear attention 真的能做到 1M 吗?
-
"长上下文 vs RAG"怎么选?
-
我的理解:
-
真实结论:
-
日期:
66. 为什么"上下文越长,模型越蠢"?中间信息丢失是怎么发生的?
追问链:
-
"Lost in the middle"现象是什么?
-
needle-in-a-haystack eval 怎么测?
-
为什么训练分布外的长度性能会崩?
-
怎么让长上下文真正"用起来"?
-
我的理解:
-
真实结论:
-
日期:
九、Prompt 与上下文工程
67. 同一个问题不同 prompt 能差 30% 准确率,背后机制是什么?
追问链:
-
prompt 敏感度能用什么指标量?
-
同一 prompt 重复几次可能不一样,为什么?
-
为什么 chat template 影响这么大?
-
System prompt 和 user prompt 权重有差别吗?
-
我的理解:
-
真实结论:
-
日期:
68. Few-shot 里那几个"例子"对模型做了什么?它是真的在"学"吗?
追问链:
-
in-context learning 真的是"学"吗?
-
例子的顺序为什么影响结果?
-
几个例子怎么选最有代表性?
-
为什么 zero-shot 在某些任务反而更好?
-
我的理解:
-
真实结论:
-
日期:
69. Chain-of-Thought 让模型变聪明,是真推理还是"装推理"?
追问链:
-
CoT 什么时候有效,什么时候没用?
-
"Let's think step by step"只是咒语还是真机制?
-
CoT 越长越好吗?
-
准确率和 token 消耗怎么权衡?
-
我的理解:
-
真实结论:
-
日期:
70. 结构化输出(JSON / tool schema)是硬约束还是软引导?
追问链:
-
constrained decoding 怎么做到硬约束?
-
JSON mode 底层是 grammar 限制还是 fine-tune?
-
带 schema 会降低自由度牺牲效果吗?
-
函数调用 schema 和 JSON schema 一样吗?
-
我的理解:
-
真实结论:
-
日期:
71. Prompt caching 到底在缓存什么?为什么能省 90% 成本?
追问链:
-
Anthropic / OpenAI 的 caching 机制分别是什么?
-
"前缀匹配"的严格程度?
-
cache TTL 通常多久?
-
动态 RAG 场景怎么利用 caching?
-
我的理解:
-
真实结论:
-
日期:
十、Agent
72. 一个 Agent 和"LLM + while 循环"本质上有区别吗?
追问链:
-
"有状态" vs "无状态"的本质区别?
-
Agent 是不是一个抽象层的名字?
-
按"能自主决定下一步"的标准,传统程序算 agent 吗?
-
Anthropic/LangChain/OpenAI 的 agent 定义差在哪?
-
我的理解:
-
真实结论:
-
日期:
73. Tool use(function calling)底层怎么实现的?模型真的在"调用"吗?
追问链:
-
模型输出 tool call JSON,实际执行谁做?
-
没有原生 tool use 的模型能做 function calling 吗?
-
tool schema 越详细越好吗?
-
为什么有时模型"幻觉工具"?
-
我的理解:
-
真实结论:
-
日期:
74. ReAct 模式的 Reasoning + Acting 交替在解决什么问题?
追问链:
-
Reasoning 和 Acting 交替的必要性?
-
纯 Reasoning 后一起 Acting 会怎样?
-
ReAct 常见失败模式有哪些?
-
为什么后来 Reflexion 又加了"反思"?
-
我的理解:
-
真实结论:
-
日期:
75. 为什么 multi-agent 不总是比 single-agent 好?
追问链:
-
multi-agent 好在哪、坏在哪?
-
"辩论/投票"机制能提升准确率吗?
-
token 消耗和延迟怎么控制?
-
什么时候真的需要 multi-agent?
-
我的理解:
-
真实结论:
-
日期:
76. MCP(Model Context Protocol)在标准化什么?和 OpenAPI 是什么关系?
追问链:
-
MCP 的三个核心概念(tools/resources/prompts)?
-
MCP 和 OpenAPI 目标为什么不同?
-
MCP server 和 client 的边界?
-
MCP 的局限性在哪?
-
我的理解:
-
真实结论:
-
日期:
77. Agent 最难的部分是规划、记忆,还是工具调用?
追问链:
-
三种失败的典型表现?
-
为什么长期记忆比短期工作记忆难?
-
工具越多为什么效果反而下降?
-
分层规划(hierarchical planning)能缓解吗?
-
我的理解:
-
真实结论:
-
日期:
78. Agent 跑 30 步后效果崩塌,root cause 通常是哪一类?
追问链:
-
"error compounding"怎么发生?
-
上下文污染的几种形式?
-
长程任务怎么设 checkpoint?
-
human-in-the-loop 什么时候必要?
-
我的理解:
-
真实结论:
-
日期:
79. Agent 的 eval 为什么比 LLM 的 eval 难一个数量级?
追问链:
-
LLM eval 有标准答案,agent eval 为什么没有?
-
trajectory-based eval 是什么?
-
τ-bench 这类 benchmark 怎么设计?
-
现实世界的 agent 怎么上线测试?
-
我的理解:
-
真实结论:
-
日期:
十一、RAG
80. RAG 解决了 LLM 的哪个根本短板?
追问链:
-
LLM 的"参数知识"局限在哪?
-
实时性、私域、可溯源三个维度怎么考虑?
-
只靠长上下文不用 RAG 能解决吗?
-
RAG = 外部记忆这个比喻准确吗?
-
我的理解:
-
真实结论:
-
日期:
81. 为什么 chunk size 这么关键?过大过小分别坏在哪?
追问链:
-
太小会怎样?太大会怎样?
-
semantic chunking / agentic chunking 是什么?
-
怎么根据任务选 chunk size?
-
重叠(overlap)的必要性?
-
我的理解:
-
真实结论:
-
日期:
82. 向量检索召回的是"相似的",为什么常常不是"相关的"?
追问链:
-
embedding 相似度捕捉的是什么维度?
-
为什么"反义词"在 embedding 空间也很近?
-
rerank 怎么补救?
-
查询改写(query rewriting)的作用?
-
我的理解:
-
真实结论:
-
日期:
83. Hybrid search(BM25 + 向量)为什么稳定胜过单一方案?
追问链:
-
BM25 擅长什么?向量擅长什么?
-
RRF(Reciprocal Rank Fusion)怎么融合?
-
sparse vector(SPLADE)介于两者之间?
-
权重怎么调?
-
我的理解:
-
真实结论:
-
日期:
84. RAG 什么时候应该升级成微调?判断标准是什么?
追问链:
-
知识类 → RAG,风格/格式 → 微调?
-
微调后知识新鲜度怎么办?
-
要改"说话风格"该怎么办?
-
RAG + LoRA 组合的案例?
-
我的理解:
-
真实结论:
-
日期:
十二、多模态
85. CLIP 是怎么把"图"和"文"放进同一个向量空间的?
追问链:
-
contrastive learning 怎么把图文"拉"到一起?
-
负样本(negative sampling)为什么关键?
-
CLIP 只能做检索还是能做分类?
-
CLIP 的局限在哪?
-
我的理解:
-
真实结论:
-
日期:
86. 一个 VLM 看图时,图像是怎么变成 token 进到 LLM 里的?
追问链:
-
图像 patch 是怎么变成 token 的?
-
vision encoder 和 LLM 怎么对接?
-
LLaVA 架构核心是什么?
-
高分辨率图怎么处理?
-
我的理解:
-
真实结论:
-
日期:
87. Whisper 为什么在嘈杂环境下也能工作得好?
追问链:
-
Whisper 的架构和数据规模?
-
"多任务训练"怎么帮助泛化?
-
为什么它能自动检测语言?
-
幻觉(生造内容)在 Whisper 里也存在吗?
-
我的理解:
-
真实结论:
-
日期:
88. Sora 这类视频生成,本质上在建模什么?
追问链:
-
视频被建模成什么(时空 patch)?
-
diffusion 在视频上的挑战是什么?
-
物理一致性问题为什么难?
-
离"世界模型"还有多远?
-
我的理解:
-
真实结论:
-
日期:
十三、生成模型家族
89. Diffusion 的核心思想是"加噪再去噪",为什么这么绕反而效果好?
追问链:
-
为什么"加噪"能被学会反转?
-
DDPM 的数学本质是什么?
-
采样步数和质量的取舍?
-
diffusion 比 autoregressive 生成图的优势?
-
我的理解:
-
真实结论:
-
日期:
90. 从 DDPM 到 DiT,这一步让 Sora 成为可能——它改了什么?
追问链:
-
DiT 把 U-Net 换成了什么?
-
这个替换为什么让 scaling 成为可能?
-
latent diffusion 又做了什么优化?
-
Sora 在 DiT 之上加了什么?
-
我的理解:
-
真实结论:
-
日期:
91. GAN 为什么被 Diffusion 打败了?
追问链:
-
GAN 的训练不稳定从哪里来?
-
mode collapse 是什么?
-
Diffusion 在质量/多样性/可控性上为什么全胜?
-
GAN 现在还有什么地位?
-
我的理解:
-
真实结论:
-
日期:
92. 自回归图像生成(VAR)和 Diffusion 是一回事吗?
追问链:
-
VAR 的"next scale prediction"是什么?
-
和 diffusion 的根本差别?
-
速度优势在哪?
-
未来图像生成会统一到 autoregressive 吗?
-
我的理解:
-
真实结论:
-
日期:
十四、前沿架构
93. MoE(混合专家)为什么能"用一部分参数推理但效果像大模型"?
追问链:
-
"稀疏激活"是什么意思?
-
router 是怎么决定走哪个专家的?
-
MoE 训练不稳定的根源?
-
DeepSeek-V3 的 MoE 设计有什么特点?
-
我的理解:
-
真实结论:
-
日期:
94. Mamba 想取代 Transformer 的哪部分?你判断它会成功吗?
追问链:
-
状态空间模型的核心思想?
-
Mamba 的"selective"是什么?
-
长序列上 Mamba 真的打败 Transformer 了吗?
-
hybrid 架构(Jamba)是折中还是未来?
-
我的理解:
-
真实结论:
-
日期:
95. o1 / R1 这种推理模型和普通 LLM 的本质区别是什么?
追问链:
-
"test-time compute"和普通推理的差别?
-
这些模型是 SFT 还是 RL 出来的?
-
chain-of-thought 能看到吗(o1 隐藏、R1 公开)?
-
这是通往 AGI 的路还是死胡同?
-
我的理解:
-
真实结论:
-
日期:
96. "Test-time compute"为什么被认为是下一个 scaling 方向?
追问链:
-
为什么它是新的 scaling 维度?
-
和参数/数据 scaling 的关系?
-
tree search + LLM 是什么路线?
-
极限在哪?
-
我的理解:
-
真实结论:
-
日期:
十五、评估、安全与大局观
97. MMLU 考 90 分意味着什么?它能代表"智能"吗?
追问链:
-
MMLU 包含哪些学科?分布如何?
-
饱和(saturation)是什么现象?
-
数据污染怎么影响分数?
-
除了 MMLU 还有什么更有区分度的 benchmark?
-
我的理解:
-
真实结论:
-
日期:
98. Prompt injection 为什么这么难防?
追问链:
-
为什么这是"架构性"问题?
-
常见攻击模式有哪些?
-
tool use 下的 prompt injection 有多危险?
-
业界的缓解方案?
-
我的理解:
-
真实结论:
-
日期:
99. 机制可解释性(mechanistic interpretability)最近发现了什么值得震惊的东西?
追问链:
-
feature circuits 是什么?
-
superposition 假设被证实了吗?
-
sparse autoencoder 最近的进展?
-
距离"读懂模型"还有多远?
-
我的理解:
-
真实结论:
-
日期:
100. 未来 5 年 AI 最可能的三条路线是什么?你怎么判断自己该押哪条?
追问链:
-
agent 路线、推理模型路线、多模态路线怎么对比?
-
开源 vs 闭源会怎么分化?
-
scaling 会撞墙吗?
-
作为工程师该押哪条?
-
押错的止损信号是什么?
-
我的理解:
-
真实结论:
-
日期: