Docs · Interview Guide
全栈面试
LLM 工程师全栈面试指南 —— 从简历到 Offer 的系统性准备,覆盖算法、八股、系统设计、行为面与谈薪。
LLM 八股 · RLHF / DPO
RLHF:3 阶段 = SFT → Reward Model → PPO。痛点:训练复杂、不稳定。
DPO:用偏好数据直接优化策略,跳过 RM 训练,更稳定、更易复现。当前业界主流。
💬
常考:「为什么 DPO 比 RLHF 更受欢迎?」→ 训练简单、超参少、效果与 PPO 持平甚至更好。