▲ 人工智能实训Day2:大模型对齐技术实践——SFT与DPO 姓姓王者的博客 xingwangzhe.fun 2026/06/24 人工智能实训Day2笔记:使用LLaMA-Factory对Qwen1.5-0.5B-Chat进行SFT监督微调(GSM8K)与DPO直接偏好优化(Math-Step-DPO-10K),包括CoT推理增强与β参数敏感性分析。… 讨论 登录后参与讨论 还没有评论,来说第一句吧。 姓王者的博客 的其他文章 Ubuntu Intel 性能模式问题排查:我修复 i7-1260P 的 PPD Governor 切换 2026/10/09 Vibe Coding 写 Rust:CJK 字体分片与 WOFF2 缓存优化复盘 2026/10/08 [短讯]:查询whois for edu.cn 2026/10/04 Whois edu.cn? CERNIC介绍 2026/09/27 明月几时有:月相的知识 2026/09/26
讨论
登录后参与讨论
还没有评论,来说第一句吧。