强化学习讲义1——RL-for-LLM技术选择决策图Tricks-or-Traps 发表于 2026-09-23 | 分类于 机器学习 , 大模型讲义 | 阅读次数 本文主要总结了LitePPO论文观点的若干基本问题,和我自己的一些体会。 阅读全文 »
大语言模型研究10——RubricRL实践 发表于 2026-09-16 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文主要总结了RubricRL的若干基本问题,和我自己的一些体会。rubrics(量规)是实践成本二级摊销,它的判分质量上界由世界模型、规范先验、激发工程和多步因果推理共同决定。这使得Rubrics评分成为了一个工程问题:Rubrics-engineering、Rubrics-Agent、Rubrics-Infra都是应有之意。 阅读全文 »
大语言模型研究09-RubricRL理论分析 发表于 2026-09-14 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文主要总结了RubricRL的若干基本问题,和我自己的一些体会。rubrics(量规)是实践成本二级摊销,它的判分质量上界由世界模型、规范先验、激发工程和多步因果推理共同决定。这使得Rubrics评分成为了一个工程问题:Rubrics-engineering、Rubrics-Agent、Rubrics-Infra都是应有之意。 阅读全文 »
RNN的复兴04:线性注意力并行计算DPLR 发表于 2026-08-18 | 分类于 机器学习 , RNN的复兴 | 阅读次数 本文主要总结了注意力机制优化之DPLR并行计算的若干基本问题,和我自己的一些体会。无论是KDA论文,还是RWKV论文在论述并行算法时都是极度的不友好,符号过于丑陋。描述也是一略而过,看的是云里雾里。本文使用清晰的符号和下角标,尽可能优雅描述并行计算的每个部分,带你快速看懂像现代RNN的并行算法。 阅读全文 »
大语言模型研究16——注意力机制优化之稀疏注意 发表于 2026-05-25 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文主要总结了注意力机制优化之稀疏注意的若干基本问题,和我自己的一些体会。 阅读全文 »
大语言模型研究14——注意力机制优化之FlashAttention 发表于 2026-05-19 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文主要总结了注意力机制优化之FlashAttention的若干基本问题,和我自己的一些体会。 阅读全文 »
大语言模型研究15——注意力机制优化之KV缓存 发表于 2026-05-19 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文主要总结了注意力机制优化之KV缓存的若干基本问题,和我自己的一些体会。 阅读全文 »
大语言模型研究12——均方根层归一化(RMSNorm) 发表于 2026-05-18 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文意在理清RMSNorm的基础问题。均方根层归一化(Root Mean Square Layer Normalization,RMSNorm)已成为 LLaMA、Qwen、Grok 等主流大语言模型的标配归一化方案。它以极简的设计——仅用均方根做重缩放,省略传统层归一化的均值减法——在保持甚至超越模型性能的同时,显著降低了计算开销与显存占用,并提升了深层网络的训练稳定性。本文从数学定义、梯度推导、缩放不变性与隐式学习率适应、几何统一性及高维正交性等角度,系统介绍 RMSNorm 的技术细节,并给出面向实践的解读与使用建议。若有错误,请大家指正。 阅读全文 »
大语言模型研究11——分词器从原理到实战 发表于 2026-05-11 | 分类于 机器学习 , 大语言模型研究 | 阅读次数 本文主要总结了大模型中分词器的若干基本问题,和我自己的一些体会。 阅读全文 »
RNN的复兴03:线性注意力并行计算IPLR 发表于 2025-08-17 | 分类于 机器学习 , RNN的复兴 | 阅读次数 本文主要总结了现代RNN的并行计算的若干基本问题,和我自己的一些体会。主要为接下来的RNN的复兴系列文章,做一点知识介绍。 阅读全文 »