Skip to content

大模型面试宝典 · 全书目录

三十一、大模型——Chat o1 篇 🔥

千面郎君 篇(三十一章)—— OpenAI o1 篇

  • 千面郎君 篇(三十一章)—— OpenAI o1 篇

    • 一、Shortcut learning (捷径学习) vs Journey learning (旅程学习)
      • 1.1 Shortcut learning (捷径学习)
        • 1.1.1 什么是 Shortcut learning (捷径学习)?
        • 1.1.2 Shortcut learning (捷径学习) 包含哪些关键特征?
        • 1.1.3 Shortcut learning (捷径学习) 优点是什么?
        • 1.1.4 Shortcut learning (捷径学习) 缺点是什么?
      • 1.2 Journey learning (旅程学习)
        • 1.2.1 什么是 Journey learning (旅程学习)?
        • 1.2.2 Journey learning (旅程学习) 包含哪些关键特征?
        • 1.2.3 Journey learning (旅程学习) 优点是什么?
      • 1.3 Shortcut learning (捷径学习) vs Journey learning (旅程学习)
    • 二、o1 的长思维链篇
      • 2.1 o1 的长思维链是什么样子?
      • 2.2 长思维 (Long thought) 是如何工作的?
      • 2.3 如何构建长思维?
    • 三、过程奖励模型 (PRM)篇
      • 3.1 为什么需要 过程奖励模型 (PRM)?
      • 3.2 过程奖励模型 (PRM) 作用是什么?
      • 3.3 过程奖励模型 (PRM) 目标值定义?
      • 3.4 过程奖励模型 (PRM) 思路介绍?
      • 3.5 如何训练 过程奖励模型 (PRM) ?
        • 3.5.1 介绍一下 ORM 目标函数?
        • 3.5.2 介绍一下 PRM 目标函数?
        • 3.5.3 如何构建 PRM 训练数据?
        • 3.5.4 PRM 训练细节?
          • 3.5.4.1 将输入数据转化为模型输入(token id)
          • 3.5.4.2 利用 PRM 对每个步骤打分
          • 3.5.4.3 完整代码
    • 四、on-policy 推理树篇
      • 4.1 如何构建 on-policy 推理树?
      • 4.2 如何从推理树中推导出 Long Thought?
    • 五、如何评估尝试方法?
    • 六、如何训练模型?
      • 6.1 第一阶段:监督微调(SFT)
      • 6.2 第二阶段:直接偏好学习(DPO)
    • 七、什么是人类和 AI 协同标注的有效策略?
  • 点击查看答案

OpenAI o1 面试篇

  • OpenAI o1 面试篇

    • Q: o1 的训练方法与之前的模型有何主要区别?
    • Q: o1 的"思考"过程与简单的提示有何不同?
    • Q: 为什么 o1 在推理任务上比之前的模型更强大?
    • Q: o1 如何处理安全性问题?
    • Q: o1 在数学和编程任务上有哪些具体的改进?
    • Q: o1 Mini 与完整版 o1 模型相比如何?
    • Q: o1 是否只擅长数学和 STEM 任务?
    • Q: 给予 o1 更多时间如何增强其推理能力?
    • Q: o1 如何决定在给定问题上花费多少时间进行推理?
    • Q: 当前 o1 思考时间的瓶颈是否由上下文长度决定?
    • Q: o1 在更抽象、创造性领域的表现如何?
    • Q: o1 的改进是否仅仅由训练数据的变化导致的?
    • Q: 科学家如何帮助构建用于科学发现的 AGI?
    • Q: o1 是否表现出意识或自我意识的特征?
    • Q: o1 的推理时间和质量之间是否存在线性关系?
    • Q: 在开发 o1 时,研究人员的第一个"啊哈时刻"是什么?
    • Q: o1 如何处理工具使用以进行自我验证或理智检查?
    • Q: o1 如何处理更主观任务中的文化背景?
    • Q: o1 Mini 如何在更小更便宜的同时实现其性能?
    • Q: 改进 o1 和 o1 Mini 的下一步计划是什么?
    • 致谢
  • 点击查看答案

Scaling LLM Test-Time:谁说类o1推理一定要用RL?

  • Scaling LLM Test-Time:谁说类o1推理一定要用RL?

    • 一、Scaling LLM Test-Time 介绍篇
      • 1.1 为什么需要 Scaling LLM Test-Time?
      • 1.2 三种 Scaling LLM Test-Time 类型定义?
      • 1.3 有哪些 Scaling Test-Time的方法?
      • 问题引申
    • 二、方法一:纯 Inference Scaling 篇
      • 2.1 Inferece Test-Time的统一视角:Proposer & Verifier
      • 2.2 Proposer & Verifier 实例:Best-of-N
      • 2.3 Process Reward Modeling
        • 2.3.1 结果奖励模型(Outcome Reward Model, ORM) 有什么问题?
        • 2.3.2 为什么要用 过程奖励模型(Process Reward Model, PRM)?
        • 2.3.3 为什么有ORM了还需要PRM?
        • 2.3.4 介绍一下 PRM建模:Let’s Verify Step by Step?
        • 2.3.5 介绍一下 PRM建模:reward-to-go?
        • 2.3.6 OpenAI PRM 建模 和 Math-Shephered PRM 建模 的区别?
        • 2.3.7 介绍一下 PRM使用实例?
        • 2.3.8 介绍 PRM数据格式?
      • 2.4 搜索方法 Process-Searching
        • 2.4.1 介绍一下 Best-of-N Weighted?
        • 2.4.2 介绍一下 Beam Search PRM?
        • 2.4.3 介绍一下 LookAhead Search?
        • 2.4.4 对比 Best-of-N Weighted 和 Beam Search PRM 和 LookAhead Search 效能?
      • 2.5 不同的PRM search在各难度问题的表现
      • 2.6 小结
    • 三、方法二:推理能力增强
      • 3.1 什么是提议分布 ?
      • 3.2 什么是 修改提议分布 ?
      • 3.3 什么是 Self-Improve ?
      • 3.4 什么是 revision 数据收集 ?
      • 3.5 什么是 revision model结果 ?
      • 3.6 什么是 verifier 训练方案 ?
      • 3.7 小结
    • 四、Pretrain Compute V.S. Scaling Test Time
      • 4.1 Exchange Rate度量
      • 4.2 小模型推理token增加14倍就能战胜大模型?
      • 4.3 完整的性能表现
      • 4.4 小结
    • 五、Scaling LLM Test-Time总结
  • 点击查看答案