Docs · Interview Guide

全栈面试

LLM 工程师全栈面试指南 —— 从简历到 Offer 的系统性准备,覆盖算法、八股、系统设计、行为面与谈薪。

LLM 八股 · RLHF / DPO

RLHF:3 阶段 = SFT → Reward Model → PPO。痛点:训练复杂、不稳定。

DPO:用偏好数据直接优化策略,跳过 RM 训练,更稳定、更易复现。当前业界主流。

💬

常考:「为什么 DPO 比 RLHF 更受欢迎?」→ 训练简单、超参少、效果与 PPO 持平甚至更好。