近期随想:大模型、一手感觉与语言腐败

Hello 大家,好久不见。有一段时间没更新了——其实不是没写东西,只是写到了别的地方。现在来写写近期的感受和想法。 笔记方法的转变:从单篇笔记到体系化知识 首先,我并不是没有写笔记,只是改变了写笔记的方法。最近做了两个笔记项目:一个是之前宣传过的 LLM Notes All-in-One,另一部分是量化相关的笔记。这两部分笔记我都改变了组织形式。 ...

2026-07-10 · 22 分钟 · 10600 字 · LEE

LLM 真的在做强化学习吗?还是一种加权 MLE?

这篇文章是我正在整理的开源项目 leemojiang/llm-notes-all-in-one 中 RL for LLM 系列的一篇。项目会持续整理 LLM、强化学习、Agent 和从零实现大模型相关的学习笔记。如果这份笔记对你有帮助,也欢迎到 GitHub 点一个 Star 支持一下。 ...

2026-06-16 · 2 分钟 · 640 字 · LEE

一把梭穿强化学习在大模型中的应用?

Hello 啊,大家好。我之前一直有一个想法只用一页纸,把强化学习相关的这些东西,尤其是在大模型应用中的这部分推导给写清楚。通俗地讲,就是达到概念的闭包:我希望把推导中涉及的所有概念,尤其是它所依赖的概念和定义,都给写清楚。 ...

2026-06-01 · 8 分钟 · 3674 字 · LEE