柠檬CC
小白爱吃柠檬O(∩_∩)O
首页
分类
归档
标签
诗集
关于
搜索
close
AI
标签
大语言模型研究18——线性回归视角看强化学习策略梯度
10-08
强化学习讲义2——MiMoV2.6组级智能体评分
09-27
强化学习讲义1——RL-for-LLM技术选择决策图Tricks-or-Traps
09-23
大语言模型研究10——RubricRL实践
09-16
大语言模型研究09-RubricRL理论分析
09-14
大语言模型研究17——强化学习中KL散度惩罚问题
06-28
大语言模型研究16——注意力机制优化之稀疏注意
05-25
大语言模型研究14——注意力机制优化之FlashAttention
05-19
大语言模型研究15——注意力机制优化之KV缓存
05-19
大语言模型研究12——均方根层归一化(RMSNorm)
05-18
1
2
'