大模型面试宝典 · 全书目录
三十一、大模型——Chat o1 篇 🔥
千面郎君 篇(三十一章)—— OpenAI o1 篇
千面郎君 篇(三十一章)—— OpenAI o1 篇
- 一、Shortcut learning (捷径学习) vs Journey learning (旅程学习)
- 1.1 Shortcut learning (捷径学习)
- 1.1.1 什么是 Shortcut learning (捷径学习)?
- 1.1.2 Shortcut learning (捷径学习) 包含哪些关键特征?
- 1.1.3 Shortcut learning (捷径学习) 优点是什么?
- 1.1.4 Shortcut learning (捷径学习) 缺点是什么?
- 1.2 Journey learning (旅程学习)
- 1.2.1 什么是 Journey learning (旅程学习)?
- 1.2.2 Journey learning (旅程学习) 包含哪些关键特征?
- 1.2.3 Journey learning (旅程学习) 优点是什么?
- 1.3 Shortcut learning (捷径学习) vs Journey learning (旅程学习)
- 1.1 Shortcut learning (捷径学习)
- 二、o1 的长思维链篇
- 2.1 o1 的长思维链是什么样子?
- 2.2 长思维 (Long thought) 是如何工作的?
- 2.3 如何构建长思维?
- 三、过程奖励模型 (PRM)篇
- 3.1 为什么需要 过程奖励模型 (PRM)?
- 3.2 过程奖励模型 (PRM) 作用是什么?
- 3.3 过程奖励模型 (PRM) 目标值定义?
- 3.4 过程奖励模型 (PRM) 思路介绍?
- 3.5 如何训练 过程奖励模型 (PRM) ?
- 3.5.1 介绍一下 ORM 目标函数?
- 3.5.2 介绍一下 PRM 目标函数?
- 3.5.3 如何构建 PRM 训练数据?
- 3.5.4 PRM 训练细节?
- 3.5.4.1 将输入数据转化为模型输入(token id)
- 3.5.4.2 利用 PRM 对每个步骤打分
- 3.5.4.3 完整代码
- 四、on-policy 推理树篇
- 4.1 如何构建 on-policy 推理树?
- 4.2 如何从推理树中推导出 Long Thought?
- 五、如何评估尝试方法?
- 六、如何训练模型?
- 6.1 第一阶段:监督微调(SFT)
- 6.2 第二阶段:直接偏好学习(DPO)
- 七、什么是人类和 AI 协同标注的有效策略?
- 一、Shortcut learning (捷径学习) vs Journey learning (旅程学习)
OpenAI o1 面试篇
OpenAI o1 面试篇
- Q: o1 的训练方法与之前的模型有何主要区别?
- Q: o1 的"思考"过程与简单的提示有何不同?
- Q: 为什么 o1 在推理任务上比之前的模型更强大?
- Q: o1 如何处理安全性问题?
- Q: o1 在数学和编程任务上有哪些具体的改进?
- Q: o1 Mini 与完整版 o1 模型相比如何?
- Q: o1 是否只擅长数学和 STEM 任务?
- Q: 给予 o1 更多时间如何增强其推理能力?
- Q: o1 如何决定在给定问题上花费多少时间进行推理?
- Q: 当前 o1 思考时间的瓶颈是否由上下文长度决定?
- Q: o1 在更抽象、创造性领域的表现如何?
- Q: o1 的改进是否仅仅由训练数据的变化导致的?
- Q: 科学家如何帮助构建用于科学发现的 AGI?
- Q: o1 是否表现出意识或自我意识的特征?
- Q: o1 的推理时间和质量之间是否存在线性关系?
- Q: 在开发 o1 时,研究人员的第一个"啊哈时刻"是什么?
- Q: o1 如何处理工具使用以进行自我验证或理智检查?
- Q: o1 如何处理更主观任务中的文化背景?
- Q: o1 Mini 如何在更小更便宜的同时实现其性能?
- Q: 改进 o1 和 o1 Mini 的下一步计划是什么?
- 致谢
Scaling LLM Test-Time:谁说类o1推理一定要用RL?
Scaling LLM Test-Time:谁说类o1推理一定要用RL?
- 一、Scaling LLM Test-Time 介绍篇
- 1.1 为什么需要 Scaling LLM Test-Time?
- 1.2 三种 Scaling LLM Test-Time 类型定义?
- 1.3 有哪些 Scaling Test-Time的方法?
- 问题引申
- 二、方法一:纯 Inference Scaling 篇
- 2.1 Inferece Test-Time的统一视角:Proposer & Verifier
- 2.2 Proposer & Verifier 实例:Best-of-N
- 2.3 Process Reward Modeling
- 2.3.1 结果奖励模型(Outcome Reward Model, ORM) 有什么问题?
- 2.3.2 为什么要用 过程奖励模型(Process Reward Model, PRM)?
- 2.3.3 为什么有ORM了还需要PRM?
- 2.3.4 介绍一下 PRM建模:Let’s Verify Step by Step?
- 2.3.5 介绍一下 PRM建模:reward-to-go?
- 2.3.6 OpenAI PRM 建模 和 Math-Shephered PRM 建模 的区别?
- 2.3.7 介绍一下 PRM使用实例?
- 2.3.8 介绍 PRM数据格式?
- 2.4 搜索方法 Process-Searching
- 2.4.1 介绍一下 Best-of-N Weighted?
- 2.4.2 介绍一下 Beam Search PRM?
- 2.4.3 介绍一下 LookAhead Search?
- 2.4.4 对比 Best-of-N Weighted 和 Beam Search PRM 和 LookAhead Search 效能?
- 2.5 不同的PRM search在各难度问题的表现
- 2.6 小结
- 三、方法二:推理能力增强
- 3.1 什么是提议分布 ?
- 3.2 什么是 修改提议分布 ?
- 3.3 什么是 Self-Improve ?
- 3.4 什么是 revision 数据收集 ?
- 3.5 什么是 revision model结果 ?
- 3.6 什么是 verifier 训练方案 ?
- 3.7 小结
- 四、Pretrain Compute V.S. Scaling Test Time
- 4.1 Exchange Rate度量
- 4.2 小模型推理token增加14倍就能战胜大模型?
- 4.3 完整的性能表现
- 4.4 小结
- 五、Scaling LLM Test-Time总结
- 一、Scaling LLM Test-Time 介绍篇
