最近更新 10 个月前近 12 个月 1 篇
11月10月(本月)
文章
- RL 后训练进化论:从PPO被动奖励、GRPO组内奖励到DeepSeekMath-V2自验证奖励
- 个人数据低成本自动化备份方案
- 异地组网:免域名免备案自建Tailscale DERP节点
- 家庭网络配置:利用 Docker 在闲置笔记本上运行 OpenWRT 作为旁路由
- 专家混合模型 (MoE) 详解:Mixtral 8X7B、DBRX 和 Deepseek-v2 的架构与应用
- 数学视角下的支持向量机(SVM):优化问题求解
- VLDB 2024广州之旅
- 数据枯竭危机:AI发展面临的数据瓶颈与应对措施
- 微调GPT-4o-mini生成博客文章
- AI Agent智能体四类设计模式:通用人工智能必经之路