强化学习(RL)¶
约 329 个字 预计阅读时间 2 分钟
相关资料¶
- Numerical Stability
- ai基础
- 大模型部署参考
- 蘑菇书EasyRL
- paperlists
- DDAO: An Open-source RL System from ByteDance Seed and Tsinghua AIR
- Simple PyTorch Implementations of Deep RL Algorithms for Continuous Control Research
- ReaderLM-v2
深度学习(DL)¶
CS231n¶
其他¶
- 《Attention Is All You Need阅读笔记》
- 动手学深度学习
- 动手学深度学习笔记:CNN、RNN、CV、NLP
- 深度学习知识合集 · 语雀
- UMich EECS 498-007 / 598-005: Deep Learning for Computer Vision课程笔记
- CMU DLsys 作业实现
相关资料¶
- Birdclef中几个模型转换成 openvino格式
- 一本挺好的介绍神经网络和深度学习的书
- 深度学习为啥不用二阶牛顿寻优?
- log_softmax与softmax的区别在哪里? - 以往的月的回答 - 知乎 <!--
- 神经网络可解释性综述
- 深度学习模型编译框架TVM概述
深度强化学习(DRL)¶
王树森¶
- 王树森 深度强化学习 L1
- 王树森 深度强化学习 L2
- 王树森 深度强化学习 L3
- 王树森 深度强化学习 L4 - Actor-Critic方法
- 王树森 深度强化学习 L5 - AlphaGo
- 王树森 深度强化学习 L6 - Monte Carlo
- 王树森 深度强化学习 L7 - 均匀随机排列与Fisher-Yates算法
- 王树森 深度强化学习 L8,9,10 - TD-learning
- 王树森 深度强化学习 L10,11,12 - 价值学习高级技巧
- 王树森 深度强化学习 L13,14,15,16 - 策略梯度中的baseline
- 王树森 深度强化学习 L17,18,19 - 连续控制
CS285¶
- Laurie's Site
- CS 285 MBRL理论分析和HW4 - justopit
- CS 285 Q-Learning 和 HW3
- CS 285 策略梯度和HW2
- CS 285 学习 - justopit
CMU10414¶
其他¶
机器学习(ML)¶
- Ng-Machine learning 课程笔记 - amaranth的叶栈漫谈
- 概率图模型&机器学习 -- 精确推断方法 -- 变量消去(Variable Elimination)和信念传播(Belief Propagation) - 伊犁纯流莱 - 博客园
- Mathematical-Foundation-of-Reinforcement-Learning
- ML system 入坑指南
- Machine Learning Systems课程
- CacheBlend:面向 RAG 的缓存知识融合与大模型推理加速 — 论文提出 CacheBlend,通过复用知识缓存加速检索增强生成场景中的大语言模型推理。
- 机器学习工程
相关资料¶
- 我模拟了一万个 Polymarket 赛季:只有 3 种策略存活了下来
- 王树森的推荐系统- Kinnari's Blog
- Geoffrey Hinton带你拆解 AI“理解” 的本质 | IASEAI 2025
- 最近meta推出v-jepa 2分析了一下JEPA
- AB实验中样本选择偏差DEMO分析