LLM¶
约 424 个字 预计阅读时间 2 分钟
- 漫谈 LLM 解码策略:采样策略(贪心解码、随机采样、Top-K 采样、Top-P 采样、核采样)和搜索策略( Beam Search) - 姚远的文章 - 知乎
- tiny-llm
- 自己手撕复现的deepseek稀疏注意力nsa
- 大模型理论基础
- 动手学大模型
- 大语言模型概念
- 最小熵原理(六):词向量的维度应该怎么选择? - 科学空间|Scientific Spaces
- Github上一个面向开发者的大模型手册
- LLM-Action
- 根据最小熵原理分析 transformer 中的词向量维度应该怎么选取
相关资料¶
- 大模型应用开发 -上下文工程与运行空间实践指南
- DeepSeek-V4
- The Ultra-Scale Playbook: Training LLMs on GPU Clusters
- 预训练语言模型(PLM, Pretraining Language Model)
- 大模型核心概念科普:Token、上下文长度、最大输出,一次讲透
- 大模型Blog
- Qwen模型微调之SFT
- 万字长文图解Qwen2.5-VL实现细节
- 大模型的Loss Landscape是什么样的?
- 对RoPE理解挺好的
- The last six months in LLMs, illustrated by pelicans on bicycles
- LLM的快思考与慢思考路线之MCTS - haotian的文章
- 按照苏神类似的思路推理Transformer中的Softmax Attention为什么要除以√d_k?
- AI大模型
- 最近读了一遍 nano-vllm 的源码,做了些笔记,欢迎群友补充~
- 大模型核心概念科普:Token、上下文长度、最大输出,一次讲透
- 2024年LLM实习岗面经(一名大四学生的碎碎念)
- DeepSeek+LoRA+FastAPI开发人员如何微调大模型并暴露接口给后端调用
- SpatialLM-Llama-1B
- 课程推荐 Advanced Natural Language Processing