Awesome-LLM Milestone Papers: explore LLM's history and state-of-the-art | |||||||
Paper Name | Paper Keywords | Article Category | Source | Rating | Resources | Note | |
1 | Attention Is All You Need( https://arxiv.org/pdf/1706.03762 ) - Source Code https://github.com/tensorflow/tensor2tensor/blob/master/tensor2tensor/models/transformer.py (official tensorflow implementation) - PyTorch implementation of the Transformer model https://github.com/jadore801120/attention-is-all-you-need-pytorch 这篇论文是LLM入门必读,很多精读文章和视频都写得不错;这里主要选了一些带有相关拓展背景知识的精读,让小白也能轻松get到attention的思想 | Transformers | 技术细节梳理, 引导理解, 技术点详解, 相关拓展, 见解分析 | 知乎 | ★★★★★ | 【经典精读】万字长文解读Transformer模型和Attention机制 | 这篇博客主要是介绍Transformer的,从Transformer和attention的背景开始介绍,对于技术细节的解释很清晰且易懂,文章逻辑通顺 |
GitHub | ★★★★★ | The Illustrated Transformer | 图文结合的非常详细的介绍 | ||||
Other | ★★★★★ | Attention Is All You Need (Transformer) 论文精读 | 补充背景知识的部分让论文更好理解,全文讲解过程也用了很多简单的实际例子来介绍抽象概念,对于论文的精读是有重点的 | ||||
CSDN | ★★★★★ | 【Transformer系列(3)】 《Attention Is All You Need》论文超详细解读(翻译+精读) https://blog.csdn.net/weixin_43334693/article/details/130208816 | 这篇博客是一个系列:从encoder&decoder,到attention,论文和transformer一步一步深入解读。这篇精读也包括翻译+精读部分帮助理解 | ||||
技术细节梳理, 引导理解, 相关拓展, 见解分析 | CSDN | ★★★★★ | Transformer通俗笔记:从Word2Vec、Seq2Seq逐步理解到GPT、BERT | 可以看出作者很有思想,文章介绍了一系列的预训练模型,通俗易懂的带领读者理解透彻该模型的目的 | |||
精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 《Attention Is All You Need》论文解读 | 深入浅出的精读论文,讲解的时候加入了一些例子,对小白很友好 | |||
精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | Transformer论文逐段精读【论文精读】 | 逐段精读,评论区有一些笔记以及补充知识 | |||
引导理解, 代码解析 | 知乎 | ★★★★☆ | Transformer 零基础解析教程,完整版代码最终挑战(4/4) | 解析了原文代码;这篇文章也是系列解读中的一篇,同系列解读也很不错,但是需要一些基础 | |||
2 | Improving Language Understanding by Generative Pre-Training https://www.cs.ubc.ca/~amuham01/LING530/papers/radford2018improving.pdf - Unofficial Pytorch Implementation | GPT 1.0 | 技术细节梳理, 引导理解, 技术点详解, 相关拓展, 见解分析 | CSDN | ★★★★★ | ChatGPT技术原理解析:从RL之PPO算法、RLHF到GPT4、instructGPT | 这篇文章写清楚了ChatGPT背后的所有关键细节,分为好几个部分,用通俗易懂的语言解释抽象概念 |
技术细节梳理, 引导理解, 技术点详解, 代码解析 | CSDN | ★★★★☆ | GPT1:Improving Language Understanding by Generative Pre-Training https://blog.csdn.net/sinat_34461199/article/details/135404779 | 这篇博客的逻辑很通顺,简要介绍了背景和创新点,然后仔细分析了GPTv1的实现,简要分析了代码 | |||
技术细节梳理, 引导理解, 技术点详解 | CSDN | ★★★★★ | GPT-1原理-Improving Language Understanding by Generative Pre-Training https://blog.csdn.net/weixin_41885239/article/details/137119048 | 这篇博客记录了博主对论文的理解和见解,用通俗的语言解释论文的动机,猜想,结构,微调,最后还总结了一些缺陷 | |||
精读视频, 引导理解, 见解分析 | Bilibili | ★★★★★ | [论文简析]Improving fine-grained understanding in image-text pre-training[2401.0986] | 清晰流畅的精读视频,虽然不是一句一句带读论文,但是能够get到重点 | |||
相关拓展 | CSDN | ★★★☆☆ | GPTv1,2,3 | 简单总结对比了GPT v1, v2, v3,感觉很适合放在课件里做一个对比讲解 | |||
3 | BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding https://aclanthology.org/N19-1423.pdf - Source Code | BERT, Transformers | 精读视频, 见解分析, 引导理解, 技术点详解 | Bilibili | ★★★★★ | BERT 论文逐段精读【论文精读】 | 李沐老师的逐段精读,非常清晰 |
技术细节梳理, 引导理解 | CSDN | ★★★★★ | 【李沐论文精读】BERT精读 | 根据李沐老师的精读视频总结的精读笔记;中间有一些读论文中的问题以及回答,顺着逻辑更好理解论文 | |||
技术细节梳理, 引导理解, 见解分析 | 知乎 | ★★★★★ | 读懂BERT,看这一篇就够了 | 非常细致的精读,其中还包括一个思维导图,对每个部分的解读都非常详细易懂 | |||
技术细节梳理, 引导理解, 见解分析 | CSDN | ★★★★★ | 【论文精读】BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding https://blog.csdn.net/weixin_46803857/article/details/129008322 | 很精致的阅读笔记,对论文的每一部分都有全面的翻译,重点标注和总结,最后有博主的一些个人观点 | |||
代码复现, 论文开源项目教程, 相关拓展, 代码解析, 技术点详解, 模型使用教程 | 博客园 | ★★★★★ | 基于bert-base-chinese训练bert模型(最后附上整体代码) | 提供数据集,基于bert-base-chinese模型训练一个BERT模型的教程,提供了一些讲解以及代码详细解析 | |||
引导理解, 代码解析 | GitHub | ★★★★★ | BERT-Easy-Tutorial https://github.com/chenaoxuan/BERT-Easy-Tutorial/blob/master/docs/README_ZH.md | 对于BERT代码的详细解析 | |||
技术细节梳理 | 微信 | ★★★★☆ | 大模型必读系列01:BERT精读笔记 | 比较中规中矩的精读文章 | |||
论文开源项目教程 | 博客园 | ★★★☆☆ | BERT初体验:谷歌开源bert环境配置(Win10) | 安装package后运行开源代码的教程,比较简洁 | |||
4 | Language Models are Unsupervised Multitask Learners - Source code | GPT2.0 | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | GPT,GPT-2,GPT-3 论文精读【论文精读】 | 李沐老师逐段精读三片论文 |
精读视频, 见解分析, 引导理解, 代码解析 | Bilibili | ★★★★★ | 72、爆火的GPT-2论文讲解 | 逐段讲解了的GPT-2论文,并提供了一些自己的思考 | |||
代码复现 | CSDN | ★★★★☆ | GPT2训练自己的对话问答机器人 https://blog.csdn.net/weixin_38226321/article/details/130046504 | 基于GPT2的中文闲聊机器人,模型实现基于HuggingFace的transformers, 精读GPT2-Chinese的论文和代码,参考了https://github.com/yangjianxin1/GPT2-chitchat | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★☆ | GPT2.0 Language Models are Unsupervised Multitask Learners 论文解读 | 文中有博主的个人见解,但是整篇文章是偏翻译的解读 | |||
技术细节梳理 | 知乎 | ★★★☆☆ | 【论文精读】GPT2 | 对论文的核心方法和实验部分详解 | |||
技术细节梳理 | 知乎 | ★★★☆☆ | 【论文阅读】GPT 2: Language Models are Unsupervised Multitask Learners | 逻辑比较清晰的总结精读 | |||
5 | Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism https://arxiv.org/pdf/1909.08053 - Source Code https://github.com/NVIDIA/Megatron-LM - Official Presentation slides | Transformers, tensor, Pytorch, Megatron | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | Megatron LM 论文精读【论文精读】 | 李沐老师逐段带读 |
技术细节梳理, 技术点详解 | 知乎 | ★★★★★ | 深入理解 Megatron-LM(1)基础知识 | 这是一个系列文章中的第一篇,后面几篇在文章结尾有链接,是更加深入的细节解读,非常干活 | |||
技术细节梳理, 技术点详解 | CSDN | ★★★★☆ | 详解MegatronLM Tensor模型并行训练(Tensor Parallel) https://blog.csdn.net/qinduohao333/article/details/131617757 | 详细介绍了论文中用到的方法,论文比较硬核,稍微有点抽象 | |||
技术点详解 | 知乎 | ★★★★☆ | 读论文《Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism 》 | 对于技术的详解,没有梳理论文,主要关注了重点的技术创新点 | |||
模型使用教程 | 知乎 | ★★★★☆ | 如何使用 Megatron-LM 训练语言模型 | 分析了该模型与GPT2.0的不同之处,介绍如何使用 Megatron-LM框架训练 | |||
代码解析 | Other | ★★★★★ | Megatron-LM源码系列(六):Distributed-Optimizer分布式优化器实现Part1 | 介绍了模型的实现和代码解读 | |||
6 | Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer https://jmlr.org/papers/volume21/20-074/20-074.pdf - Source Code https://github.com/google-research/text-to-text-transfer-transformer | Transformers, T5 | 技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 论文阅读之Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(2020) | 这篇博客的作者一段一段分析解释论文,带领读者理解,选出其中比较有意思的部分重点讲解,有自己的思考 |
精读视频, 引导理解 | Bilibili | ★★★★★ | 半小时学透万能大模型:谷歌T5模型结构和原理!一个大一统的NLP处理框架T5打破Few-shot Learning的次元壁垒!预训练模型 | 很通透的精读视频,会用一些通俗的例子来解释,ppt做的也不错 | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★☆ | T5论文笔记(Text-To-Text Transfer Transformer) | 精读文章,不是纯翻译,比较通俗易懂 | |||
模型使用教程, 模型实战 | CSDN | ★★★★☆ | NLP实践——以T5模型为例训练seq2seq模型 https://blog.csdn.net/weixin_44826203/article/details/126295253 | 以T5为例,介绍如何利用transformers模块搭建生成式模型,并训练seq2seq生成模型 | |||
模型实战 | 代码先锋网 | ★★★★☆ | NLP:T5模型实战(on BoolQ) | T5实战的教程,用T5实现binary_classification | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★☆ | T5:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(万字长文略解T5) | 比较全面的精读,有点偏翻译 | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★☆☆ | 文献阅读笔记:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5) | ||||
略读文章, 见解分析, 引导理解, 知乎讨论 | 知乎 | ★★★☆☆ | T5 模型:NLP Text-to-Text 预训练模型超大规模探索 | 比较简单通俗易懂的介绍 | |||
引导理解 | Bilibili | ★★★☆☆ | 半小时学透万能大模型:谷歌T5模型结构和原理!一个大一统的NLP处理框架T5打破Few-shot Learning的次元壁垒!预训练模型 | 快速理解T5模型的视频,需要有一定的background knowledge | |||
代码解析 | 知乎 | ★★★☆☆ | huggingface t5代码解读 | 对于T5模型的代码详解,对实现模型很有帮助 | |||
略读文章, 引导理解 | 知乎 | ★★☆☆☆ | 预训练(2):T5语言模型论文讲解 | 逻辑清晰,用自己的语言总结介绍了模型结构和实验,有楼主自己的思考和见解 | |||
略读文章, 相关拓展 | 知乎 | ★★☆☆☆ | 大模型 | T5 vs BERT vs GPT | 关于大模型各个方面的对比 | |||
7 | ZeRO: Memory Optimizations Toward Training Trillion Parameter Models https://arxiv.org/pdf/1910.02054 - ZeRO is shared as a part of open source DL training optimization library — DeepSpeed - Source Code https://github.com/microsoft/deepspeed - DeepSpeed Website | ZeRO | 精读视频, 引导理解, 见解分析, 技术点详解 | Bilibili | ★★★★★ | Zero 论文精读【论文精读】 | 李沐老师的逐段精读 |
技术细节梳理, 引导理解, 相关拓展 | 知乎 | ★★★★★ | ZeRO: Zero Redundancy Optimizer,一篇就够了。 | 博主在阅读了很多精读笔记的基础上总结出的更为详细全面的精读,确实是涵盖了很多知识点,语言也很通俗易懂,一步一步带着读者理解 | |||
模型实战, 技术细节梳理, 技术点详解 | 博客园 | ★★★★★ | DeepSpeed 学习 [2]: 从 0 开始 DeepSpeed 实战 | 和现有的tutorial相比,从初学者的视角并且关于一些容易 confused 的地方进行一定程度的 follow up 先进行一些 DDP 的铺垫,防止后续的内容引出突兀;一步一步深入理解代码和配置 | |||
技术细节梳理, 见解分析, 引导理解, 技术点详解 | CSDN | ★★★★★ | [论文笔记]ZeRO: Memory Optimizations Toward Training Trillion Parameter Models | 非常详细全面的解读,带领读者理解论文的细节 | |||
ZeRO论文精读 | |||||||
Youtube | ★★★★★ | Turing-NLG, DeepSpeed and the ZeRO optimizer | 很清晰的overview,介绍了ZeRO的原理 | ||||
8 | Scaling Laws for Neural Language Models https://arxiv.org/pdf/2001.08361 - Source Code | Scaling Law | 技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★☆ | LLM:Scaling Laws for Neural Language Models (上) | 写的非常详细并且引导理解的系列解读,但是中和下需要付费会员 |
LLM:Scaling Laws for Neural Language Models (中) | |||||||
LLM:Training Compute-Optimal Large Language Models(下) | |||||||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | OpenAI的Scaling Law论文笔记 | 博主自己的理解贯穿全文,通俗易懂 | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 【论文阅读】Scaling Laws for Neural Language Models(2020)- 大模型预训练参数量、数据集大小、计算资源之间的关系验证 https://blog.csdn.net/weixin_36488653/article/details/140120350 | 逻辑和讲解都很清晰,先说结论,然后详解定律 | |||
略读文章, 引导理解, 见解分析 | 知乎 | ★★★★☆ | Scaling Laws for Neural Language Models | 清晰易懂的总结,比较简要 | |||
见解分析 | 知乎 | ★★★☆☆ | Comments | Scaling Laws for Neural Language Models | 主要是对论文提出了一些自己的看法和见解 | |||
翻译式解读 | 知乎 | ★★★☆☆ | 【大模型】Scaling Laws for Neural Language Models | 论文翻译 | |||
9 | Language Models are Few-Shot Learners https://papers.nips.cc/paper/2020/file/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf - Source Code | GPT3.0 | 技术细节梳理, 引导理解 | CSDN | ★★★★☆ | 【论文笔记】Language Models are Few-Shot Learners B部分 | 先回顾GPT1和2,然后一段一段精读论文,标注重点 |
见解分析, 翻译式解读 | CSDN | ★★★★★ | 人工智能论文GPT-3(1):2020.5 Language Models are Few-Shot Learners;摘要;引言;scaling-law | 分为五个部分非常细致的翻译,每部分结尾有博主自己的思考和评论 | |||
人工智能论文GPT-3(2):2020.5 Language Models are Few-Shot Learners;微调;少样本Few-Shot (FS) | |||||||
人工智能论文GPT-3(3):2020.5 Language Models are Few-Shot Learners;架构;训练数据集;开源 | |||||||
人工智能论文GPT-3(4):2020.5 Language Models are Few-Shot Learners;结果;局限性;结果报告而非论文 | |||||||
人工智能论文GPT-3(5):2020.5 Language Models are Few-Shot Learners;总结 | |||||||
10 | Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity https://arxiv.org/pdf/2101.03961 - Source Code https://github.com/google-research/t5x - Tensorflow Implementation https://github.com/tensorflow/mesh/blob/master/mesh_tensorflow/transformer/moe.py | Switch Transformers | 技术细节梳理, 见解分析, 引导理解, 技术点详解 | Other | ★★★★★ | MOE论文详解(3)-Switch Transformers:Scaling to Trillion Parameter Models with Simple and Efficient Sparsity | 总结得比较清晰的精读,通俗易懂 |
见解分析, 引导理解 | 博客园 | ★★★★★ | 【译】稀疏混合专家模型的崛起: Switch Transformers | 写得很通俗易懂的文章,看完就能了解论文的核心部分 | |||
技术细节梳理, 引导理解, 技术点详解 | CSDN | ★★★★★ | 深入解读首个万亿级语言模型Switch Transformer https://blog.csdn.net/c9Yv2cf9I06K2A9E/article/details/116177508 | 很全面,比较中规中矩 | |||
技术细节梳理, 引导理解, 技术点详解 | 知乎 | ★★★★★ | Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity 精度与翻译 | 精读+翻译 | |||
技术细节梳理, 引导理解, 技术点详解 | CSDN | ★★★★☆ | 谷歌新语言模型Switch Transformer | 主要对模型的架构进行了详细解读 | |||
见解分析, 引导理解 | 知乎 | ★★★★☆ | Switch Transformer: 高效稀疏的万亿参数Transformer | 博主用自己的理解记录下的相关知识点,不是特别细致,需要一些前置知识 | |||
略读文章, 模型实战, 相关拓展, 代码解析 | 知乎 | ★★★★★ | Switch Transformer:MoE+Transformer 分本分类案例(Keras + PyTorch) | 展示了 Switch Transformer (Fedus et al., 2021)模型在文本分类中的实现,对代码有一些解读 | |||
11 | Evaluating Large Language Models Trained on Code https://arxiv.org/pdf/2107.03374 - Source Code | Codex | 精读视频, 见解分析, 引导理解, 技术点详解 | Bilibili | ★★★★★ | OpenAI Codex 论文精读【论文精读】 | 李沐老师的逐段论文精读 |
略读文章, 相关拓展 | CSDN | ★★★★☆ | ChatGPT的朋友们:大语言模型经典论文一次读到吐 https://blog.csdn.net/weixin_36896856/article/details/130776264 | 对ChatGPT相关的论文的简要略读,放在一起可以直观看到各个模型的进化史 | |||
相关拓展, 知乎讨论 | 知乎 | ★★★☆☆ | ChatGPT 已经对程序员造成了什么影响? | 关于AI coding的一些讨论 | |||
12 | On the Opportunities and Risks of Foundation Models https://arxiv.org/pdf/2108.07258 - Source Code https://github.com/PBusienei/Opportunities-and-Risks-of-Foundation-Models | Foundation Models | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 斯坦福两百页论文讨论《基础模型(GPT3, DALL-E等)的风险和机会》 Opportunities/Risks of Foundation Models | 这篇论文非常长分了很多部分,这个视频介绍了论文的主要观点和核心思想 |
技术细节梳理, 见解分析, 引导理解, 技术点详解 | CSDN | ★★★★★ | 【深度学习:Foundation Models】基础模型完整指南 | 讲的很透彻的精读,总结了论文的核心部分 | |||
技术细节梳理, 见解分析, 引导理解 | 知乎 | ★★★★☆ | [论文分享]On the Opportunities and Risks of Foundation Models | 本文翻译了原文中的部分章节,对于大部分引用的出处、内容,以及一些详细的分析和推论并没有深入了解,盖因原文太长所致。 对于不熟悉大模型领域知识的相关人员,本文能够抛砖引玉,对于大模型技术的前世今生进行一个深入浅出的介绍 | |||
相关拓展, 代码解析 | 知乎 | ★★★☆☆ | ChatGPT 有多高的技术壁垒?国内外除了 OpenAI 还有谁可以做到类似程度? | 虽然不是精读,但是是一个值得思考的问题 | |||
13 | Finetuned Language Models are Zero-Shot Learners https://openreview.net/pdf?id=gEZrGCozdqR - Source Code | FLAN | 技术细节梳理, 见解分析, 引导理解 | 知乎 | ★★★★★ | Finetuned Language Models are Zero-shot Learners | 较为全面的精读,语言也比较通俗易懂 |
【LLM系列-04】Finetuned Language Models Are Zero-Shot Learners | |||||||
相关拓展 | 知乎 | ★★★★☆ | Instruction Finetune | 虽然不是论文的精读,但是概括了几篇比较有名的论文来探讨prompt engineering和Instruction Finetune,分析得也很易懂清晰 | |||
技术细节梳理, 翻译式解读 | CSDN | ★★★★☆ | 【论文阅读】Finetuned Language Models Are Zero-Shot Learners | 偏翻译的精读 | |||
精读视频, 见解分析, 引导理解 | Bilibili | ★★★★☆ | 语言模型是小样本学习者 (Language Models are Few-Shot Learners) - GPT-3 | 比较清晰流畅的精读视频,用一个ppt来总结论文每个部分,不是逐段精读 | |||
略读文章, 见解分析 | CSDN | ★★★☆☆ | 文献阅读:Finetuned Language Models Are Zero-Shot Learners https://blog.csdn.net/codename_cys/article/details/128994708 | 简单介绍了一下论文的方法和实验,发表了一些读者自己的看法 | |||
别再Prompt了!谷歌提出tuning新方法,强力释放GPT-3潜力! | |||||||
14 | Multitask Prompted Training Enables Zero-Shot Task Generalization https://arxiv.org/pdf/2110.08207 - Source Code for trained models https://github.com/bigscience-workshop/t-zero - Source Code for prompts | T0 | 技术细节梳理, 引导理解 | 知乎 | ★★★★★ | 【LLM系列-06】Multitask Prompted Training Enables Zero-Shot Task Generalization | 总结精读了论文的各个section |
技术细节梳理, 引导理解 | CSDN | ★★★★☆ | 【论文阅读】Multitask Prompted Training Enables Zero-shot Task Generalization | 中规中矩的精读文章 | |||
略读文章, 相关拓展 | 知乎 | ★★★★☆ | 打开模型Zero-Shot新范式:Instruction Tuning | 对instruction tuning相关论文的串联解读,很好的知识拓展总结 | |||
15 | GLaM: Efficient Scaling of Language Models with Mixture-of-Experts https://arxiv.org/pdf/2112.06905 - No Source Code | GLaM | 技术细节梳理, 见解分析, 引导理解, 技术点详解 | 腾讯云 | ★★★★★ | 1.2万亿参数:谷歌通用稀疏语言模型GLaM,小样本学习打败GPT-3 | 详细精读了模型架构和实验结果 |
技术细节梳理, 相关拓展, 引导理解 | 博客园 | ★★★★★ | GPT-3被超越?解读低能耗、高性能的GlaM模型 | 从背景知识逐步引导读者理解,逻辑清晰 | |||
略读文章, 相关拓展 | CSDN | ★★★★☆ | 稀疏大模型简述:从MoE、Sparse Attention到GLaM | 概括了三篇论文的核心,从三个方面叙述了不同模型/论文的focus | |||
相关拓展 | HuggingFace | ★★★☆☆ | Mixture of Experts Explained | 关于Mixture-of-Experts的比较全面的介绍 | |||
16 | WebGPT: Browser-assisted question-answering with human feedback https://www.semanticscholar.org/reader/2f3efe44083af91cef562c1a3451eee2f8601d22 - Open-sourced Microsoft Bing Web Search API https://www.microsoft.com/en-us/bing/apis/bing-web-search-api | WebGPT | 技术细节梳理, 相关拓展, 引导理解, 精读视频 | Bilibili | ★★★★★ | 2023 - 李宏毅 - 生成式模型的两种策略 + 能够使用工具的WebGPT | lecture的一个节选,讲的非常好很连贯,用简单易懂的例子帮助理解 |
技术细节梳理, 相关拓展, 引导理解, 精读视频 | Bilibili | ★★★★★ | 台大陈蕴侬老师带你理清【ChatGPT】对话机器人的前世今生,从InstructGPT到WebGPT,快速搞定难懂知识点!!!ChatGPT注册|对话机器人 | 一共三个视频包括了InstrcutGPT, ChatGPT和WebGPT,清晰易懂 | |||
技术细节梳理, 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 你不该错过的论文:New Bing背后的技术WebGPT//一起来读论文吧 | 带领读者读论文的精读视频,讲的很清楚 | |||
技术细节梳理, 引导理解, 技术点详解 | CSDN | ★★★★★ | 自然语言处理】【ChatGPT系列】WebGPT:基于人类反馈的浏览器辅助问答 https://blog.csdn.net/bqw18744018044/article/details/128570804 | 比较细致的论文精读 | |||
技术细节梳理, 见解分析, 引导理解, 略读文章 | CSDN | ★★★★★ | 论文 | WebGPT: Browser-assisted question-answering with human feedback | 不算特别详细,但是比较通俗易懂 | |||
技术细节梳理, 见解分析, 引导理解, 略读文章 | Other | ★★★★☆ | WebGPT 简读 | 有一些个人见解的技术点总结,快速抓住论文核心要点 | |||
17 | Improving language models by retrieving from trillions of tokens https://arxiv.org/pdf/2112.04426 - Pytorch implementation (Unofficial) https://github.com/lucidrains/RETRO-pytorch?tab=readme-ov-file | Retro | 技术细节梳理, 见解分析, 引导理解, 精读视频 | Youtube | ★★★★★ | The Illustrated Retrieval Transformer (video) https://www.youtube.com/watch?v=sMPq4cVS4kg The Illustrated Retrieval Transformer (blog) http://jalammar.github.io/illustrated-retrieval-transformer/ | 很清晰的讲解,以图文结合的方式帮助理解 |
技术细节梳理, 见解分析, 引导理解, 技术点详解 | 知乎 | ★★★★★ | RETRO: Improving language models by retrieving from trillions of tokens | 主要结合论文介绍了训练数据和模型结构,讲解得比较深入 | |||
技术细节梳理, 引导理解, 技术点详解 | 博客园 | ★★★★★ | 以小25倍参数量媲美GPT-3的检索增强自回归语言模型:RETRO | ||||
模型使用教程, 代码解析 | 懂AI | ★★★★★ | RETRO-pytorch | RETRO-pytorch是一个基于PyTorch实现的检索增强变换器(RETRO)模型,博客是运行教程 | |||
技术细节梳理, 见解分析, 引导理解 | 知乎 | ★★★★☆ | Improving language models by retrieving from trillions of tokens | 逻辑清晰的从几个section总结精读论文,不是特别详尽 | |||
代码解析 | Other | ★★★☆☆ | RETRO 训练数据集 | RETRO训练dataset的代码详解 | |||
18 | Scaling Language Models: Methods, Analysis & Insights from Training Gopher https://arxiv.org/pdf/2112.11446 - No Source Code | Gopher | 技术细节梳理, 引导理解, 技术点详解, 翻译式解读 | CSDN | ★★★★★ | LLMs之Gopher/Chinchilla:《Training Compute-Optimal Large Language Models》的翻译与解读 | 非常细致全面的逐段翻译精读 |
19 | Chain-of-Thought Prompting Elicits Reasoning in Large Language Models | CoT | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | Chain of Thought论文、代码和资源【论文精读·43】 | 带着读者一步一步理解context,逐段精读论文,娓娓道来,非常清楚 |
技术细节梳理, 引导理解, 见解分析, 技术点详解 | 知乎 | ★★★★★ | CoT开山之作:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 论文解读 | 比较中规中矩的精读文章,总结了论文各个部分的内容 | |||
技术细节梳理, 引导理解, 见解分析, 技术点详解 | CSDN | ★★★★★ | 大模型思维链论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》简要介绍 | 可以看出博主写文章的思考,提出需要读者关注的问题,解析相关技术知识,最后有一个思维导图 | |||
相关拓展, 见解分析, 技术点详解 | 知乎 | ★★★★★ | 一文读懂:大模型的思维链 CoT(Chain of Thought) | 对CoT的详尽介绍,延伸到了以后的发展和其他应用领域如agent | |||
相关拓展, 见解分析, 技术点详解 | CSDN | ★★★★☆ | 大模型思维链(Chain-of-Thought)技术原理 https://blog.csdn.net/2401_85343303/article/details/144238140 | 介绍了 CoT 以及后续的改进,从背景知识开始带着读者理解prompt到CoT的演变史,拓展了一整条发展链条,逻辑很清楚 | |||
技术细节梳理, 相关拓展, 见解分析, 技术点详解 | 知乎 | ★★★☆☆ | Chain of Thought 开山之作论文详解 | 介绍了三篇CoT相关的论文,串在一起一步一步深入,讲解得比较透彻 | |||
★★★☆☆ | 解锁LLMs的“思考”能力:Chain-of-Thought(CoT) 技术推动复杂推理的新发展 | ||||||
20 | LaMDA: Language Models for Dialog Applications https://arxiv.org/pdf/2201.08239 - Source Code | LaMDA | 技术细节梳理, 引导理解 | 知乎 | ★★★★★ | 对话机器人之LaMDA | 精读了文章的核心部分,比较通俗易懂 |
略读文章, 见解分析 | CSDN | ★★☆☆☆ | 文献阅读:LaMDA: Language Models for Dialog Applications https://blog.csdn.net/codename_cys/article/details/130544821 | 总结了论文的具体工作,但是并不是特别细致的精读,加入了一些博主的个人见解 | |||
相关拓展, 见解分析 | 知乎 | ★★☆☆☆ | 谷歌LaMDA|工业级端到端预训练对话模型 | 非论文精读文章,主要是博主对于打造实际能用的对话产品的看法,以及LaMDA模型在对话任务中利用LLM的启发 | |||
21 | Solving Quantitative Reasoning Problems with Language Models https://arxiv.org/pdf/2206.14858 - Unofficial Implementation in Pytorch | Minerva | 技术细节梳理, 引导理解 | Other | ★★★★☆ | Minerva: A Breakthrough in Quantitative Reasoning for Language Models https://www.33rdsquare.com/minerva-googles-language-model-for-quantitative-reasoning/ | 以比较通俗的语言总结了论文的各个section |
略读文章, 见解分析 | 知乎 | ★★★☆☆ | 谷歌 AI 开发深度学习模型 Minerva,解决数学定量推理问题 | 简单介绍了模型的架构和性能 | |||
22 | Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model | Megatron-Turing NLG, DeepSpeed, Megatron | 引导理解, 作者presentation | Microsoft | ★★★☆☆ | Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, the World’s Largest and Most Powerful Generative Language Model | 官方博客,总结了论文的主要内容,比较像这篇论文的presentation |
略读文章, 见解分析 | 知乎 | ★★☆☆☆ | 5300亿NLP模型“威震天-图灵”发布,由4480块A100训练,微软英伟达联合出品 | 这篇论文的本质就是用很多英伟达GPU和微软分布式学习系统训练一个超大模型,可以作为了解, | |||
23 | Training language models to follow instructions with human feedback https://arxiv.org/pdf/2203.02155 - Source Code https://github.com/openai/following-instructions-human-feedback 这篇也是LLM里程碑式的一步,有很多精读笔记和翻译 | GPT3.0, InstructGPT | 精读视频, 见解分析, 引导理解, 技术点详解 | Bilibili | ★★★★★ | InstructGPT 论文精读【论文精读·48】 | 李沐老师逐段精读 |
技术细节梳理, 见解分析, 引导理解, 翻译式解读 | CSDN | ★★★★★ | Training language models to follow instructions with human feedback | 虽然博客的结构看起来稍微有点乱,但是基本是将原文重点列出来然后再翻译,逐段精读讲解,还是比较易懂的 | |||
技术细节梳理, 相关拓展, 见解分析, 引导理解 | 知乎 | ★★★★★ | ChatGPT/InstructGPT详解 | 介绍了一系列背景知识,以及InstructGPT/ChatGPT原理非常详细的解读,逻辑清晰,讲解清晰易懂 | |||
技术细节梳理, 引导理解, 见解分析, 翻译式解读 | CSDN | ★★★★★ | 【论文笔记】Training language models to follow instructions with human feedback A部分 https://blog.csdn.net/m0_48948682/article/details/138350055 【论文笔记】Training language models to follow instructions with human feedback B部分 | 基本是翻译精读,有一些重点标注,articulation也不是特别机翻,很全面 | |||
技术细节梳理, 引导理解 | CSDN | ★★★☆☆ | 【大模型】Instruct GPT :Training language models to follow instructions with human feedback https://blog.csdn.net/weixin_42018581/article/details/142152277 | 精读笔记,对论文各个部分进行概述 | |||
24 | PaLM: Scaling Language Modeling with Pathways https://arxiv.org/pdf/2204.02311 - Source Code | PaLM | 代码复现 | GitHub | ★★★★★ | Implementation of RLHF (Reinforcement Learning with Human Feedback) on top of the PaLM architecture. Basically ChatGPT but with PaLM | |
技术细节梳理, 引导理解, 技术点详解 | CSDN | ★★★★★ | 【自然语言处理】【大模型】PaLM:基于Pathways的大语言模型 https://blog.csdn.net/bqw18744018044/article/details/128809221 | 论文精读,对每个部分都概括总结 | |||
略读文章, 见解分析, 技术点详解 | 知乎 | ★★★★★ | 聊聊谷歌的超级大模型PaLM: Scaling Language Modeling with Pathways | 简单总结了论文内容,中间也穿插着自己的见解,最后提出了自己的感想 | |||
翻译式解读 | CSDN | ★★★☆☆ | LLMs:《PaLM: Scaling Language Modeling with Pathways》翻译与解读 | 一段总结性导读+全文逐段翻译 | |||
技术细节梳理, 精读视频, 论文开源项目教程, 引导理解, 见解分析 | Youtube | ★★★☆☆ | Google PaLM: Scaling Language Modeling with Pathways | 解析模型的结构,performance和应用 | |||
25 | Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models https://arxiv.org/pdf/2408.00724 - Source Code | Chinchilla, Scaling Law | 相关拓展 | CSDN | ★★★☆☆ | 大型语言模型的长文本处理能力:压缩与性能的权衡 https://blog.csdn.net/weixin_36829761/article/details/140143865 | 不是这篇论文的精读,但是是对这个topic的探讨:对多种效率驱动的压缩方法进行全面的基准测试,分析它们在不同长文本任务下的性能表现,并探讨未来长文本处理能力 LLM 的发展方向。 |
26 | OPT: Open Pre-trained Transformer Language Models https://arxiv.org/pdf/2205.01068 - Source Code | OPT | 精读视频, 见解分析, 引导理解, 作者presentation | Youtube | ★★★★★ | Open Pretrained Transformers - Susan Zhang | Stanford MLSys #77 | Stanford的一个seminar lecture,由论文作者讲解的训练模型的全过程,cover了很多细节 |
精读视频, 代码解析 | Youtube | ★★★★★ | OPT-175B: Open Pretrained Transformer | ML Coding Series | 非常详细的代码解析,分了很多section,讲解流畅,step-by-step and in-depth analysis | |||
精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 大规模语言模型 -- Meta开源OPT-175B | 谷歌发布Pathways Language Model | 带读了repo,offical blog和论文中的重点 | |||
翻译式解读 | CSDN | ★★★★☆ | LLMs:《OPT: Open Pre-trained Transformer Language Models》翻译与解读 | 一段总结性导读+全文逐段翻译 | |||
知乎讨论, 见解分析 | 知乎 | ★★★☆☆ | 如何评价 Meta AI 发布的 Open Pre-trained Transformer 语言模型? | 一些论文解读和大家对OPT模型的看法 | |||
27 | Unifying Language Learning Paradigms https://arxiv.org/pdf/2205.05131v1 - Source Code https://github.com/google-research/google-research/tree/master/ul2 | UL2 | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 统一NLP预训练范式 - UL2: Unifying Language Learning Paradigm | 详细介绍了模型的结构,精读了论文中的一些创新点,讲解清楚流畅 |
翻译式解读 | 简书 | ★★☆☆☆ | UL2:统一语言学习范式 | 论文翻译 | |||
28 | Emergent Abilities of Large Language Models | Emergent Abilities | 相关拓展, 见解分析, 引导理解 | 知乎 | ★★★★★ | 大语言模型的涌现 Emergent Abilities | 不算精读,但是对概念解释得很通俗易懂 |
相关拓展, 技术点详解 | 知乎 | ★★★★☆ | Are Emergent Abilities of Large Language Models a Mirage? | 对emergent ability的技术详解,简单明了 | |||
技术点详解, 技术细节梳理 | 知乎 | ★★★★☆ | 【自然语言处理】【ChatGPT系列】大模型的涌现能力 | 比较偏翻译的精读,很详细 | |||
知乎讨论, 见解分析, 略读文章 | 知乎 | ★★★☆☆ | 大模型的涌现能力(Emergent Abilities of LLM) | 比较简单明了 | |||
技术细节梳理, 引导理解, 翻译式解读 | 知乎 | ★★★☆☆ | [大语言模型的涌现能力]Emergent Abilities of Large Language Models(2022) | 比较中规中矩的精读,这篇论文我自己感觉有点抽象,这篇解读不算特别好懂 | |||
29 | Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models https://arxiv.org/pdf/2206.04615 - Source Code | BIG-bench | 模型使用教程, 略读文章 | CSDN | ★★★☆☆ | NLP:BIG-bench基准任务的简介、安装、使用方法之详细攻略 https://blog.csdn.net/qq_41185868/article/details/130514316 BIG-Bench Hard 数据集分享 https://blog.csdn.net/yinizhilianlove/article/details/136782036 | 模型的简介及使用教程 |
相关拓展, 引导理解 | 知乎 | ★★★★★ | Google研究人员推出大模型新基准BIG-Bench,442位作者提出204项任务,可测量模型行为并完成需求预测 | 介绍了论文提出的背景,很有用的背景知识,简单总结了论文的研究结果 | |||
30 | Language Models are General-Purpose Interfaces https://arxiv.org/pdf/2206.06336 - Source Code | METALM | 精读视频, 见解分析, 引导理解, 相关拓展 | Youtube | ★★★★★ | Harvard Medical AI: Jon Williams on "Language Models are General-Purpose Interfaces" | A talk hosted by the Rajpurkar Lab at Harvard which works on developing medical AI. Lab member Jon Williams on "Language Models are General-Purpose Interfaces" by Microsoft Research. 论文精读,对模型架构的介绍 |
31 | Improving alignment of dialogue agents via targeted human judgements | Sparrow | 技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 对话机器人之Sparrow | 带着读者理解论文的引导性理解精读,最后总结了博主的个人观点 |
技术细节梳理, 引导理解, 作者presentation | ★★★★☆ | Building safer dialogue agents https://deepmind.google/discover/blog/building-safer-dialogue-agents/ | 谷歌官方介绍该模型的博客,用一些example帮助理解模型 | ||||
略读文章, 见解分析, 引导理解 | Other | ★★★★☆ | DeepMind Sparrow 对话系统简析 | 比较简单的精读文章,对论文各个部分用自己的语言做了简要总结分析 | |||
相关拓展, 见解分析 | 知乎 | ★★★☆☆ | DeepMind推出AI聊天机器人Sparrow,可通过谷歌搜索来回答问题 | 非精读文章,关于聊天机器人的一些看法 | |||
32 | Scaling Instruction-Finetuned Language Models https://arxiv.org/pdf/2210.11416 - Source Code https://github.com/google-research/t5x/blob/main/docs/models.md#flan-t5-checkpoints | PaLM, Flan-T5 | 精读视频, 相关拓展, 见解分析, 引导理解, 技术点详解 | Youtube | ★★★★★ | Scaling Instruction-Finetuned Language Models (Flan-PaLM) | 不仅详细精读了本文模型的细节,还和prior work做了一下comparison,由浅到深的精读讲解 |
精读视频, 见解分析, 引导理解, 技术点详解 | Bilibili | ★★★★★ | FLAN-T5模型(谷歌发布的适用于多个任务的通用语言模型) | 简单易懂的讲解 | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 【LLM系列之FLAN-T5/PaLM】Scaling Instruction-Finetuned Language Models https://blog.csdn.net/yanqianglifei/article/details/130568753 | 顺着论文逻辑引导读者理解重点,比较全面细节 | |||
模型使用教程 | CSDN | ★★★★☆ | 【传知代码】Flan-T5 使用指南(论文复现) | 展示如何加载和运行 Flan-T5 模型并提供不同任务的运行示例和结果展示,以及它在不同应用场景中的实际应用和优势 | |||
略读文章, 见解分析, 引导理解 | CSDN | ★★★★☆ | Scaling Instruction-Finetuned Language Models | 总结了论文重点 | |||
技术细节梳理, 翻译式解读 | 知乎 | ★★★☆☆ | 论文笔记:Scaling Instruction-Finetuned Language Models | 偏翻译的精读 | |||
33 | GLM-130B: An Open Bilingual Pre-trained Model https://arxiv.org/pdf/2210.02414 - Source Code | GLM-130B | 精读视频, 引导理解, 技术点详解, 作者presentation | Bilibili | ★★★★★ | GLM-130B:开源的双语千亿预训练模型——可在4张3090或8张1080Ti上使用的千亿模型 | 作者本人对于模型的一个非常详细的解读介绍 |
相关拓展, 见解分析, 引导理解, 技术点详解 | Bilibili | ★★★★★ | ChatGLM 130B大模型训练教训总结 | 介绍了ChatGLM训练中有哪些问题,怎么解决,以及如何加速训练 | |||
技术细节梳理, 引导理解, 模型使用教程 | GitHub | ★★★★★ | GLM-130B:开放的中英双语预训练模型 | 官方博客,介绍了模型架构,训练和表现,以及快速上手的运行教程 | |||
技术细节梳理, 见解分析, 引导理解, 技术点详解 | 知乎 | ★★★★★ | 来自清华的ChatGPT?GLM-130B详解 | 比较全面的精读,在中间的细节实验部分有一点机翻,前后的介绍和总结有一些自己的见解 | |||
模型使用教程, 模型实战 | CSDN | ★★★★★ | GLM-130B本地部署的实战方案 | 介绍了模型本地部署的实战方案 | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 论文浅读:GLM-130B( AN OPEN BILINGUAL PRE-TRAINEDMODEL) https://blog.csdn.net/weixin_44292902/article/details/131405061 | 总结性精读,文末提出博主认为比较重要的是“通过引入嵌入层梯度收缩(Embedding Layer Gradient Shrink )来提高模型的稳定性。” | |||
见解分析, 引导理解, 代码解析, 相关拓展 | CSDN | ★★★★★ | 大模型-GLM-130B https://blog.csdn.net/poorlytechnology/article/details/133617255 | 介绍总结了GLM和ChatGLM的技术细节 | |||
34 | Holistic Evaluation of Language Models https://arxiv.org/pdf/2211.09110 - Source Code | HELM | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | HELM 全面语言模型评测【论文精读·50】 | 李沐老师的逐段精读 |
精读视频, 引导理解, 作者presentation | Youtube | ★★★★★ | Rishi Bommasani -- Holistic Evaluation of Language Models (February 15th 2023) | 论文作者的guest lecture,很详细的精读了整篇论文 | |||
模型使用教程, 模型实战, 引导理解 | Youtube | ★★★★★ | Step by Step Evaluation of AI Model Using HELM | step-by-step使用HELM来评估模型的教程实战 | |||
翻译式解读 | 知乎 | ★★★★☆ | 【骆驼读论文】斯坦福大佬Percy Liang一作,44位研究者联名,对于大语言模型的整体评估,GLM130B的得分很不错 | 论文翻译 | |||
略读文章, 技术点详解, AI Generated | CSDN | ★★★☆☆ | 论文分享丨Holistic Evaluation of Language Models | 总结介绍了论文比较重要的一些结论 | |||
35 | BLOOM: A 176B-Parameter Open-Access Multilingual Language Model https://arxiv.org/pdf/2211.05100 - HuggingFace Model Card | BLOOM | 精读视频, 相关拓展, 见解分析, 引导理解 | Bilibili | ★★★★★ | 抱抱脸的1760亿Bloom模型又什么值得期待的?新的深度学习NLP生成backbone,新的position embedding,更多语言包括代码 | 带着读者读论文,比较全面的精读视频 |
代码解析 | 知乎 | ★★★★★ | 【自然语言处理】【大模型】BLOOM模型结构源码解析(单机版) | 基于transformers中BLOOM模型代码来解析BLOOM的原理及实现,对代码进行了解析注释 | |||
相关拓展, 技术点详解 | HuggingFace | ★★★★★ | Optimization story: Bloom inference https://huggingface.co/blog/bloom-inference-optimization (翻译)优化故事: BLOOM 模型推理 | This article gives you the behind-the-scenes of how we made an efficient inference server that powers bloom. | |||
相关拓展, 技术点详解, AI Generated | CSDN | ★★★★☆ | BLOOM 模型的核心原理、局限与未来发展方向解析 https://blog.csdn.net/weixin_43114209/article/details/142697196 | 详细解析 BLOOM 系列模型的核心原理,帮助读者理解其架构设计、关键技术以及训练方法;AI生成的,有点机械 | |||
模型使用教程, AI Generated, 略读文章 | CSDN | ★★★★☆ | 全面解析开源大语言模型:BLOOM | 简要介绍了BLOOM 模型的架构,以及如何使用 BLOOM,使用BLOOM 生成创意故事 | |||
翻译式解读 | 知乎 | ★★★☆☆ | 【自然语言处理】【大模型】BLOOM:一个176B参数且可开放获取的多语言模型 | 翻译解读 | |||
略读文章, 模型使用教程 | Datacamp | ★★★☆☆ | Exploring BLOOM: A Comprehensive Guide to the Multilingual Large Language Model https://www.datacamp.com/blog/exploring-bloom-guide-to-multilingual-llm | 简单介绍了模型,用一个example介绍了如何使用该模型 | |||
36 | Galactica: A Large Language Model for Science https://arxiv.org/pdf/2211.09085 - Huggingface Model Card https://huggingface.co/facebook/galactica-6.7b - Model API for GALACTICA | Galactica | 技术细节梳理, 精读视频, 相关拓展, 见解分析, 引导理解 | Youtube | ★★★★★ | Galactica: A Large Language Model for Science (Drama & Paper Review) | This video explains the paper, but also dives into the drama that ensued once Meta released a public demo of the model. 精读部分带着读者一步一步解析论文,非常全面的介绍 |
翻译式解读 | 知乎 | ★★★☆☆ | Galactica:科学的大型语言模型 | 论文翻译 | |||
略读文章, 见解分析 | 知乎 | ★★★☆☆ | 大模型能自己「写」论文了,还带公式和参考文献,试用版已上线 | 总结介绍了模型概述和实验细节 | |||
知乎讨论, 见解分析 | 知乎 | ★★☆☆☆ | AI 模型 Galactica 可自动生成文献综述和百科等,技术上如何实现的? | 讨论了一下大家对于论文方法的解析和看法 | |||
如何看待Meta AI团队的大型语言模型Galactica? 模型的发布对未来科研产生怎样影响? | |||||||
37 | OPT-IML : Scaling Language Model Instruction Meta Learning through the Lens of Generalization https://arxiv.org/pdf/2212.12017 - HuggingFace Model Card https://huggingface.co/facebook/opt-iml-30b - Source Code https://github.com/facebookresearch/metaseq/tree/main/projects/OPT-IML | OPT-IML | 技术细节梳理, 翻译式解读 | 知乎 | ★★★★☆ | OPT-IML:通过泛化的视角扩展语言模型指令元学习 | 论文翻译 |
精读视频, 见解分析, 引导理解, 技术点详解 | Youtube | ★★★★★ | Meta AI OPT-IML Instruction Meta Learning LLM Research Paper Explained | 逐段论文精读,评论区的链接有一个demo的notebook https://colab.research.google.com/drive/12fZbhsZerVxhCDgsJGhZi_CFHN7K6szY?usp=sharing | |||
精读视频, 模型使用教程 | Youtube | ★★★★★ | Meta AI OPT Open Pre-trained Transformer Language Models OPT-175B and OPT 1.3B Demo | A short explanation and demo of OPT-175B and OPT 1.3B models | |||
精读视频, 引导理解, 见解分析, 模型使用教程, 代码解析 | Youtube | ★★★★★ | OPT-IML - InstructGPT's baby brother from Meta AI - Code Tutorial | 对于代码的精讲tutorial:https://colab.research.google.com/drive/16gFY2ZnRLbsU5U2LNtNMu8KWDvZpogAl?usp=sharing | |||
相关拓展, 见解分析 | Youtube | ★★★★☆ | Meta's OPT - GPT's Strongest Challenger in Open Source | 将OPT和GPT3做了一些介绍和对比 | |||
38 | The Flan Collection: Designing Data and Methods for Effective Instruction Tuning https://arxiv.org/pdf/2301.13688 - Source Code | FLAN | 技术细节梳理, 相关拓展, 见解分析, 引导理解, 技术点详解, 翻译式解读 | 知乎 | ★★★★★ | 谷歌大模型指令微调:The Flan Collection | 开篇总结了论文重点,然后每个section都很全面的翻译精读 |
引导理解 | Youtube | ★★★★★ | The Flan Collection: Open Source Instruction Tuning | Paper explained | 介绍了paper的introductoon,results和conclusion | |||
39 | LLaMA: Open and Efficient Foundation Language Models - HuggingFace https://huggingface.co/meta-llama - Source Code | LLaMA | 精读视频, 见解分析, 引导理解, 技术点详解 | Bilibili | ★★★★★ | 81、LLaMA-1 论文导读 | 详细介绍了LLaMA-1论文,涉及摘要、引言、方法、结果、相关工作及结论等内容,重点讲解了LLaMA-1模型的设计、训练方法和性能表现 |
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 速通LLaMA1:《LLaMA: Open and Efficient Foundation Language Models》全文解读 | 先总览了论文的创新点、突破点、技术实现、算法创新及架构升级,然后对论文每一个部分进行了详细拆分讲解,以观点+原文+小结的方式理解论文 | |||
技术细节梳理, 见解分析, 引导理解, 翻译式解读 | CSDN | ★★★★★ | LLMs之LLaMA:《LLaMA: Open and Efficient Foundation Language Models》翻译与解读 | 对论文的逐段翻译和精读总结,很全面 | |||
技术细节梳理, 相关拓展, 见解分析, 引导理解, 技术点详解, 代码解析 | CSDN | ★★★★★ | LLaMA的解读与其微调(含LLaMA 2):Alpaca-LoRA/Vicuna/BELLE/中文LLaMA/姜子牙 | LLaMA的代码级解读和各种微调LLaMA,对每个微调都有相关介绍和代码讲解 | |||
技术细节梳理, 引导理解, 技术点详解, 代码解析 | 知乎 | ★★★★★ | 论文精读:LLaMA: Open and Efficient Foundation Language Models | 非常详细的精读文章,有对代码的解析和重点内容的总结,对模型架构的解析很清楚 | |||
见解分析, 技术细节梳理 | 知乎 | ★★★★★ | Meta “单GPU” LLM模型 LLaMA: Open and Efficient Foundation Language Models - 单GPU就能干大模型到底发生了什么? | 本文适合有一定算法基础或者AI工程基础的同学科普阅读,夹带一些非技术点,算是调研总结,个人观点分享 分析了一下Llama模型的“单GPU”,梳理论文重点 | |||
技术细节梳理, 引导理解, 技术点详解, 代码解析, 翻译式解读 | 知乎 | ★★★★☆ | LLaMA:开放和高效的基础语言模型 | 比较偏翻译的精读 | |||
精读视频, 引导理解 | Youtube | ★★★★☆ | LLaMA: Open and Efficient Foundation Language Models (Paper Explained) | 带着读者一段一段精读论文 | |||
见解分析, 相关拓展, 略读文章 | CSDN | ★★★☆☆ | LLaMA: Open and Efficient Foundation Language Models论文原文代码学习 | 对论文的重点部分进行了总结(论文关键点,数据集,训练以及结果),总结了Llama和BERT,GPT的对比 | |||
40 | Language Is Not All You Need: Aligning Perception with Language Models https://arxiv.org/pdf/2302.14045 - Source Code | Kosmos-1 | 技术细节梳理, 见解分析, 知乎讨论 | 知乎 | ★★★★★ | 有没有大佬解读一下KOSMOS-1? | 这个讨论里的解读都是比较通俗易懂的,融合了不同的解读和观点 |
精读视频, 引导理解 | Youtube | ★★★★★ | Microsoft Kosmos-1 1.6B Multimodal ( Text and Image ) Large Language Model Paper Explanation | 逐段精读,对论文重点进行解读 | |||
技术细节梳理, 引导理解, 略读文章 | CSDN | ★★★★★ | 多模态大语言基座模型KOSMOS-1《Language Is Not All You Need: Aligning Perception with Language Models》论文简要介绍 | 简要总结了论文的一些关键点,以bullet lists总结了论文基本信息,模型架构和实验 | |||
翻译式解读 | 知乎 | ★★★☆☆ | [论文]KOSMOS-1——Language is not all you Need: Aligning Perception with Language Models | 论文翻译 | |||
略读文章, 见解分析 | CSDN | ★★★☆☆ | Kosmos-1: 通用接口架构下的多模态大语言模型 | 不算精读,但是以通俗易懂的语言介绍了论文的背景和方法 | |||
41 | Resurrecting Recurrent Neural Networks for Long Sequences https://arxiv.org/pdf/2303.06349 - Unofficail Pytorch Implementation https://github.com/Gothos/LRU-pytorch - Unofficial JAX implementation | LRU | 技术细节梳理, 见解分析, 技术点详解, 引导理解 | Other | ★★★★★ | Google新作试图“复活”RNN:RNN能否再次辉煌? | 对论文的背景,提出的动机以及各种技术细节,公式推导都介绍得很详细,有自己理解的同时引导读者思考 |
见解分析, 知乎讨论, 技术点详解 | 知乎 | ★★★★★ | RNN的隐藏层需要非线性吗? | 不是论文精读文章,讨论了论文的技术核心,以及和其他文章的联系,通俗易懂,见解也比较深刻 | |||
精读视频, 作者presentation, 引导理解, 技术点详解, 相关拓展 | Youtube | ★★★☆☆ | Dr. Razvan Pascanu (Google DeepMind) - Resurrecting Recurrent Neural Networks for Language Modelling | 论文作者的一个lecture,主要focus在State Space Models (SSMs) , a subclass of Recurrent Neural Networks (RNNs) that has recently gained some attention | |||
42 | PaLM-E: An Embodied Multimodal Language Model https://palm-e.github.io/assets/palm-e.pdf - Demo https://palm-e.github.io/#demo - Source Code | PaLM, PaLM-E | 技术细节梳理, 见解分析, 引导理解, 技术点详解 | 知乎 | ★★★★★ | PaLM-E: 具身多模态语言模型(Embodied Multimodal Language Model) | 讲的非常清晰细致且全面的精读和引导理解 |
技术细节梳理, 见解分析, 引导理解, 技术点详解, 略读文章 | 知乎 | ★★★★★ | 具身多模态大模型——Google PaLM-E论文解读 | 介绍了论文的内容,方法,结果和局限性 | |||
精读视频, 引导理解, 技术点详解 | Youtube | ★★★★☆ | Google PaLM-E 562B Multimodal ( Text Image Sensors ) Large Language Model Paper Explanation | 带着读者阅读了模型,demo以及论文的重点部分 | |||
技术细节梳理, 见解分析 | CSDN | ★★★★☆ | 论文阅读_PaLM-E | 开篇有博主的读后感,然后对于模型架构精读介绍 | |||
技术细节梳理, 翻译式解读 | CSDN | ★★☆☆☆ | PaLM-E: An Embodied Multimodal Language Model——一种具身多模态语言模型 | 翻译式精读 | |||
43 | GPT-4 Technical Report | GPT4 | 精读视频, 引导理解, 技术点详解, 相关拓展 | Bilibili | ★★★★★ | GPT-4论文精读【论文精读·53】 | 论文逐段精读,非常细致易懂 |
技术细节梳理, 引导理解 | CSDN | ★★★★★ | GPT-4报告解读 | 比较中规中矩的精读文章 | |||
见解分析 | 知乎 | ★★★★★ | 关于 GPT4 Tech Report 的一些观察 | 博主自己的理解解读, | |||
精读视频, 引导理解, 技术点详解 | Youtube | ★★★★☆ | GPT-4 Technical Report - Paper Review | 总结精读论文 | |||
技术细节梳理, 见解分析, 引导理解 | 知乎 | ★★★★☆ | GPT-4 Technical Report 坐马桶上就能看完的简报 | 很通俗的通读解释了文章中的重点 | |||
翻译式解读 | CSDN | ★★★★☆ | MLMs之GPT-4:《GPT-4 Technical Report》的翻译与解读 | 翻译式精读 | |||
相关拓展 | CSDN | ★★★☆☆ | GPT-1, GPT-2, GPT-3, GPT-3.5, GPT-4论文内容解读 https://blog.csdn.net/BGoodHabit/article/details/130134446 GPT-1, GPT-2, GPT-3, InstructGPT / ChatGPT and GPT-4 总结 | 介绍对比GPT家族的模型 | |||
44 | Visual Instruction Tuning https://arxiv.org/pdf/2304.08485 - Source Code | LLaVA | 精读视频, 引导理解, 技术点详解 | Bilibili | ★★★★★ | [论文速览]LLaVA: Visual Instruction Tuning[2304.08485] | 快速精读论文的重点内容和原理,清晰易懂 |
精读视频, 引导理解, 技术点详解 | Youtube | ★★★★★ | LLaVA - the first instruction following multi-modal model (paper explained) | 很细致的精读,顺着论文带着读者理解重点 | |||
见解分析 | 知乎 | ★★★★★ | Visual Instruction Tuning: 用LLaVA近似多模态GPT-4 | 分享了LlaVA模型的三个功能和博主使用模型的主要体验 | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★★ | 【多模态大模型paper阅读笔记-5】LLaVA:Visual Instruction Tuning,5千字精读,最适合入门多模态大模型的工作 | 比较细致的精读 | |||
技术细节梳理, 引导理解 | CSDN | ★★★★☆ | LLaVA论文(Visual Instruction Tuning)阅读笔记 https://blog.csdn.net/qq_58400270/article/details/135073408 LLaVA: Visual Instruction Tuning https://blog.csdn.net/weixin_44966641/article/details/136331742 | 精读笔记,梳理文章内容,不是很细节 | |||
略读文章, 技术细节梳理 | 知乎 | ★★★★☆ | 【论文解读】LLaVA:视觉指令微调(Visual Instruction Tuning) | 总结性的精读梳理 | |||
模型实战 | 知乎 | ★★★★★ | 《LLM-Adapter》:如何对LLM进行Visual Instruction Tuning得到自己的VLM,并进行Visual SFT | 模仿LLaVa对 Qwen2-0.5B-Instruct 进行Visual Instruction Tuning扩展其多模态能力,为其训练一个MLP Adapter,然后对其进行Visual SFT | |||
45 | Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling https://arxiv.org/pdf/2304.01373 - Source Code | Pythia | 略读文章, 技术细节梳理 | 知乎 | ★★★★★ | Pythia:从时间和尺度两方面解释LLM的利器 | 总结了模型简介和论文中的提到的模型案例研究 |
精读视频, 引导理解, 技术点详解 | Youtube | ★★★★★ | Eleuther AI Pythia | 非常细致的精读视频;这个印度老哥精读了很多LLM论文,虽然不是论文逐段精读,但是讲解都很清晰 | |||
46 | Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision https://arxiv.org/pdf/2305.03047 - Source Code https://github.com/IBM/Dromedary - HuggingFace Model Card | Dromedary | 技术细节梳理, 略读文章, 模型使用教程 | 知乎 | ★★★★★ | IBM也下场LLM了,自对齐、高效率的单峰驼Dromedary来了 | 问题简介,梳理了Dromedary模型(应用SELF-ALIGN到LLaMA-65b基本语言模型)的四个技术细节步骤 |
略读文章, 见解分析 | 知乎 | ★★★★☆ | Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision | 文章比较简短,开篇论文简介,介绍论文对于LLM提出的解决方案,然后简要总结; | |||
47 | PaLM 2 Technical Report | PaLM | 技术细节梳理, 略读文章, 见解分析 | CSDN | ★★★★★ | PaLM 2重磅来袭,深挖谷歌92页技术报告亮点总结 | 本文选取了论文中介绍PaLM的几个重点方面进行介绍,并结合谷歌IO大会上的一些产品亮点进行简要的总结 |
见解分析, 知乎讨论 | 知乎 | ★★★★★ | 最强语言模型 PaLM2 亮相,Bard 能力跃升,它可以实现哪些功能?算是 ChatGPT 杀手吗? | 这个讨论下的回答总结了一些论文里比较有意思的部分,加入了自己的经验,思考和分析 | |||
精读视频, 技术细节梳理, AI Generated | 知乎 | ★★★★☆ | 如何快速理解 PaLM 2 技术报告?高中生也能轻松掌握! | 一个AI-generated的精读视频,逻辑还是比较清晰的,人机感比较重 | |||
48 | RWKV: Reinventing RNNs for the Transformer Era https://arxiv.org/pdf/2305.13048 - Source Code | RWKV | 精读视频, 引导理解, 作者presentation | Bilibili | ★★★★★ | RWKV:在Transformer时代重塑RNN | 作者解读论文,非常细致全面 |
技术细节梳理, 引导理解, 相关拓展, 技术点详解, 代码解析 | 知乎 | ★★★★★ | 【手撕LLM-RWKV】重塑RNN 效率完爆Transformer | 介绍了RWKV和Transformer的对比,细致解读了模型,算法和代码 | |||
技术细节梳理, 引导理解 | 知乎 | ★★★★★ | AI论文推荐-RWKV: Reinventing RNNs for the Transformer Era | 分段总结精读论文 | |||
RWKV: Reinventing RNNs for the Transformer Era | |||||||
见解分析, 引导理解, 技术点详解 | CSDN | ★★★☆☆ | RWKV论文燃爆!将RNN崛起进行到底!可扩百亿级参数,与Transformer表现相当! | 讲解了RWKV背后的注意力、时间混合和通道混合模块的原理与组成 | |||
技术细节梳理, 引导理解 | 知乎 | ★★★★★ | RWKV 模型解析 | 讲解了RWKV的结构最核心的两部分Channel-Mixing 与 Time-Mixing | |||
49 | Direct Preference Optimization: Your Language Model is Secretly a Reward Model https://arxiv.org/pdf/2305.18290 - Source Code https://github.com/eric-mitchell/direct-preference-optimization | DPO | 精读视频, 见解分析, 引导理解 | Youtube | ★★★★★ | Direct Preference Optimization (DPO): Your Language Model is Secretly a Reward Model Explained | 带着读者读论文的精读视频,分屏操作边读边板书讲解 |
技术细节梳理, AI Generated, 见解分析 | CSDN | ★★★★★ | 【论文阅读】理解DPO,《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》 https://blog.csdn.net/bylander/article/details/141904536 【论文速读】《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》 | 个人理解总结,回顾了RLHF方法,介绍了DPO主要流程。比较有意思的是博主通过腾讯元宝生成了论文学术海报。 | |||
技术细节梳理, 见解分析, 引导理解, 略读文章 | CSDN | ★★★★★ | 【基础知识】DPO(Direct Preference Optimization)的原理以及公式是怎样的? | 总结文章重点及关键公式推导的详细步骤 | |||
技术细节梳理, 见解分析, 引导理解 | 知乎 | ★★★★★ | Direct Preference Optimization(DPO)学习笔记 | 写得很清晰的笔记,很适合做论文overview | |||
相关拓展, 引导理解 | Youtube | ★★★★★ | RLHF & DPO Explained (In Simple Terms!) | This video doesn't go deep on math. Instead, I provide a high-level overview of each technique to help you make practical decisions about where to focus your time and energy. | |||
相关拓展, 技术点详解 | Bilibili | ★★★★☆ | DPO (Direct Preference Optimization) 算法讲解 | 算法详解视频,很清晰 | |||
技术细节梳理 | 知乎 | ★★★★☆ | DPO: Direct Preference Optimization 论文解读及代码实践 | 本文重点介绍DPO的使用场景和最简代码 | |||
翻译式解读 | CSDN | ★★★☆☆ | Direct Preference Optimization: Your Language Model is Secretly a Reward Model翻译 | 论文翻译 | |||
技术点详解 | CSDN | ★★★☆☆ | Direct Preference Optimization数学知识详解 | 对于论文中的部分数学知识进行详细解释 | |||
50 | Tree of Thoughts: Deliberate Problem Solving with Large Language Models https://arxiv.org/pdf/2305.10601 - Source Code | ToT | 精读视频, 引导理解, 见解分析 | Youtube | ★★★★★ | Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Full Paper Review) | 精读paper的视频,讲解非常清晰,博主自己也有一些观点和想法 |
技术细节梳理, 见解分析, 引导理解, 技术点详解 | Medium | ★★★★★ | Paper Explained: Tree of Thoughts — Deliberate Problem Solving with Large Language Models | very insightful and informative paper summary | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★☆☆ | TOT(Tree of Thought) | 让GPT-4像人类一样思考 | 精读文章,有一些阅读笔记,related work做成了思维导图 | |||
翻译式解读 | CSDN | ★★☆☆☆ | 论文翻译 | Tree of Thoughts: Deliberate Problem Solvingwith Large Language Models 思维树ToT | 论文翻译 | |||
51 | Llama 2: Open Foundation and Fine-Tuned Chat Models https://arxiv.org/pdf/2307.09288 - Source Code | LLaMA2 | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | Llama 2 模型结构解析 | attention讲得很透彻,少有的清楚地描述QKV矩阵的形状及变换的教程视频 |
精读视频, 见解分析, 引导理解, 模型使用教程, 代码解析 | Bilibili | ★★★★★ | [LLMs 实践] 14 llama2 introduction 及 fine tune llama2(guanaco dataset) | 非常全面详细的LLama2精读系列视频,后面几节也有源码讲解 | |||
技术细节梳理, 见解分析, 引导理解 | Youtube | ★★★★★ | Llama 2: Full Breakdown | This video covers the most noteworthy bits, including: The benchmark results The decision to release in the face of the US Senate Why Zuckerberg opensourced Llama 2, including the Mistral AI Factor The opensource signatory list How Orca and Phi-1 compare Why Llama 2 might soon be everywhere | |||
技术细节梳理, 见解分析, 引导理解, 技术点详解 | 知乎 | ★★★★★ | 一文读懂Llama 2(从原理到实战) | 比较通俗地介绍了LlaMa 2的技术原理以及如何Fine-tuning | |||
技术细节梳理, 见解分析, 引导理解 | CSDN | ★★★★☆ | 速通LLaMA2:《Llama 2: Open Foundation and Fine-Tuned Chat Models》全文解读 | 非常全面的论文精读,结尾也有一些博主的thoughts | |||
Llama 2: Open Foundation and Fine-Tuned Chat Models | |||||||
技术细节梳理, 模型使用教程, 模型实战, 引导理解 | CSDN | ★★★★☆ | LLMs之LLaMA-2:LLaMA-2的简介(技术细节)、安装、使用方法(开源-免费用于研究和商业用途)之详细攻略 | LLaMA-2的简介(技术细节)、安装、使用方法(开源-免费用于研究和商业用途)之详细攻略 | |||
模型实战 | CSDN | ★★★★☆ | 打造个人聊天助手:本地部署Llama 2并通过Chatbot-Ollama实现Web交互 https://blog.csdn.net/2301_78611726/article/details/143778037 | 本文分享如何在群晖NAS上本地部署并运行一个基于大语言模型Llama 2的个人聊天机器人,并结合内网穿透工具实现公网远程访问 | |||
52 | Mistral 7B https://arxiv.org/pdf/2310.06825 - Source Code | Mistral 7B | 精读视频, 见解分析, 引导理解 | Youtube | ★★★★★ | Mistral 7b - the best 7B model to date (paper explained) | In this video let's have a look at all three contributions of the Mistral 7 billion model in detail followed by the result comparing LLAMA 2 and code LLAMA with Mistral 7b from Mistral AI. |
精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 本地 Mistral 7B 模型 推理(1/2) https://www.bilibili.com/video/BV1Ze411n7wn/ 本地 Mistral 7B 模型推理(2/2) | 讲解非常清晰详细的精读视频 | |||
模型使用教程 | Bilibili | ★★★★☆ | 击败Llama3,简单几步微调Mistral 7b v0.3大模型!本地运行+Colab微调Mistral开源大模型!没有显卡也能微调大模型!#mistral | 本期视频主要演示了如何使用ollama在本地运行mistral 7b v0.3大模型,并且使用unsloth在colab上用中文数据集微调mistral 7b,然后将量化后的GGUF模型保存到huggingface | |||
见解分析, 引导理解, 技术点详解 | CSDN | ★★★★☆ | [论文笔记]Mistral 7B | 精读了论文中的方法以及模型架构,分析模型表现,不算特别详尽 | |||
详解各种LLM系列|(3)Mistral-7B 技术内容详解 https://blog.csdn.net/weixin_49659123/article/details/135243440 | |||||||
略读文章, 模型使用教程 | CSDN | ★★★☆☆ | 开源模型Mistral 7B+Amazon SageMaker部署指南 | 模型简介+通过Amazon SageMaker JumpStart一键部署Mistral 7B 基础模型的教程 | |||
模型实战 | Kaggle | ★★★☆☆ | Retrieval Augmented Generation with Mistral 7b 翻译:为 Mistral 7b 模型构建检索增强生成 (RAG) 系统 https://blog.csdn.net/weixin_37863729/article/details/140854011 | 使用Wikipedia Crypto Articles(Kaggle 上的数据集)为 LLM 实现RAG系统 | |||
53 | Mamba: Linear-Time Sequence Modeling with Selective State Spaces https://arxiv.org/pdf/2312.00752 - Source Code | Mamba | 技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展 | CSDN | ★★★★★ | 一文通透想颠覆Transformer的Mamba:从SSM、HiPPO、S4到Mamba(被誉为Mamba最佳解读) | 点赞率很高的一篇非常通透全面的讲解,确实是“最佳解读” |
技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展 | CSDN | ★★★★★ | Mamba 基础讲解【SSM,LSSL,S4,S5,Mamba】 | 涵盖了模型的提出背景和特性介绍,以及一些补充知识 | |||
精读视频, 见解分析, 引导理解 | Youtube | ★★★★★ | Mamba: Linear-Time Sequence Modeling with Selective State Spaces (Paper Explained) | 清晰易懂的paper review | |||
Bilibili | ★★★★★ | 【汇报】 Mamba模型及其公式推导 | |||||
模型使用教程 | CSDN | ★★★☆☆ | Mamba 环境安装踩坑问题汇总及解决方法(Windows已解决) | 非常详细的记录了Mamba环境安装的问题及解决方案,并且至今一直在更新 | |||
54 | DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model https://arxiv.org/pdf/2405.04434 - Source Code | DeepSeek-v2 | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | 通过看DeepSeek-v2思考目前大模型学习路径 | 不仅带着读者一起阅读和理解paper,还提出了自己的一个学习路径,引导入门者了解人工智能和机器学习的逻辑与常识, 帮助构建自己的大型语言模型 |
技术细节梳理, 引导理解, 相关拓展 | CSDN | ★★★★★ | 一文通透DeepSeek-V2和其V3版本(改造Transformer的中文模型):详解MoE、GRPO、MLA | 从DeepSeek LLM、DeepSeekMoE到DeepSeekMath,再到DeepSeek-V2的细节,非常全面的拓展和介绍 | |||
知乎讨论, 见解分析, 相关拓展, 技术点详解 | 知乎 | ★★★★★ | 如何看待 DeepSeek 发布的 MoE 大模型 DeepSeek-V2? | 热度很高的讨论,有很多观点分享和细节分析 | |||
技术细节梳理, 引导理解, 翻译式解读 | CSDN | ★★★★☆ | 最新的混合专家大语言模型DeepSeek-V2 | 比较详细的论文精读 | |||
模型使用教程 | CSDN | ★★☆☆☆ | deepseek-v2-pytorch对话问答算法模型 | 比较简短的模型运行教程 | |||
55 | Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality https://arxiv.org/pdf/2405.21060 - Source Code | Mamba, Mamba2 | 技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展 | CSDN | ★★★★★ | 一文通透mamba2「力证Transformer are SSM」:从SSM、半可分矩阵、SMA、SSD到mamba2 | 和Mamba1的最佳解读是同一个作者,一样高质量的通透全面解读 |
精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | AI大讲堂:敢叫transformer换新天!专业拆解【Mamba-2模型】 | 万字长文人话讲解5个问题: 1. 如何用两性话题统一SSM和注意力机制? 2. SSM矩阵的巧妙设计 3. 注意力机制的通用实现 4. 状态空间对偶是什么 5. Mamba-2模型如何对Transformer形成了碾压 | |||
技术点详解, 代码解析, 引导理解 | CSDN | ★★★★★ | (简单易学)mamba2核心ssd算法逻辑整理(基于mamba2-minimal实现) | 逐步拆解Mamba-2 模型的核心算法 Structured State Space Duality (SSD),代码,理解其背后的原理和运作机制 | |||
技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展 | CSDN | ★★★★★ | Mamba v2诞生:1 儒(Transformers)释(SSD)道(Mamba)本是一家?! https://blog.csdn.net/Janexjy/article/details/139482926 Mamba v2诞生:2 那些烧脑的矩阵们 https://blog.csdn.net/Janexjy/article/details/139535672 Mamba v2诞生:3 SMA与Mamba-2 | 对于Mamba V2详细解读的一套文章 | |||
模型使用教程 | CSDN | ★★★★☆ | Mamba2-minimal(mamba2最简实现)的使用与若干问题解决办法 https://blog.csdn.net/weixin_48432756/article/details/140407066 | 由于官方实现较于复杂,不利于理解原理以及后期对模型进行改进,本文对mamba2-minimal模型进行了本地运行实验并总结了调试过程中的若干问题解决方法 | |||
56 | The Llama 3 Herd of Models https://arxiv.org/pdf/2407.21783 - Source Code | LLaMA3 | 精读视频, 见解分析, 引导理解 | Bilibili | ★★★★★ | Llama 3.1论文精读 · 1. 导言【论文精读·54】 | 李沐老师论文精讲 |
Youtube | ★★★★★ | Llama 405b: Full 92 page Analysis, and Uncontaminated SIMPLE Benchmark Results | Went through the highlights of all 92 pages 评论区也有一些非常有用的links | ||||
模型使用教程, 模型实战 | Bilibili | ★★★★★ | B站公认最强的LLAMA3保姆级教程,llama3微调-量化-部署-应用实例解读,还学不会的你来锤爆我!人工智能|机器学习|深度学习 | llama微调-量化-部署-应用一条龙解读 | |||
技术细节梳理, 引导理解, 见解分析, 技术点详解 | CSDN | ★★★★★ | 速通LLaMA3:《The Llama 3 Herd of Models》全文解读 | 论文比较长,这篇博客是非常详细的精读梳理文章,原文节选解析,详尽分析了数学原理 | |||
知乎 | ★★★★☆ | 【LLM技术报告】《The Llama 3 Herd of Models》——Llama 3.1技术报告(精华版) | 挑选精华章节的翻译和精读 | ||||
知乎讨论, 见解分析, 相关拓展, 技术点详解 | 知乎 | ★★★☆☆ | 如何看待MetaAI开源Llama3大模型? | 关于Llama3的讨论和解析 | |||
57 | Qwen2.5 Technical Report https://arxiv.org/pdf/2412.15115 - Source Code | Qwen2.5 | 精读视频, 见解分析, 引导理解, 作者presentation | Bilibili | ★★★★★ | Qwen2.5-Coder开源报告解读,prompt编程来了! | 作者本人的论文解读,非常详细易懂 |
技术细节梳理, 见解分析, 引导理解, 技术点详解 | GitHub | ★★★★★ | Qwen2.5-Coder 技术报告详细解读(非机翻) | 对coder和math部分的全面解读,带有博主自己的理解,很通俗易懂 | |||
知乎讨论, 见解分析, 相关拓展, 技术点详解 | 知乎 | ★★★★★ | 如何解读Qwen2.5 Technical Report?有哪些新的技术点耳目一新? https://www.zhihu.com/question/7364394830/answer/59941132327 | 有很多细致回答的讨论,很多总结了论文的技术细节来对比Qwen2.5的进步和performance | |||
见解分析, 引导理解, 模型实战 | Bilibili | ★★★★☆ | 最强开源编程大模型Qwen2.5-coder-32B-instruct!部署安装Bolt.new和Cline+Qwen2.5-coder多维度测试 | 部署安装Bolt.new和Cline+Qwen2.5-coder进行模型多维度测试,非常中肯的评价了模型效果 | |||
模型实战 | Bilibili | ★★★☆☆ | 【喂饭教程】20分钟学会微调大模型Qwen2.5,环境配置+模型微调+模型部署+效果展示详细教程!草履虫都能学会~ | 使用llama-factory微调QWen2.5,讲了llama-factory的参数设置,但是没有讲如何准备数据,和训练结果的使用,还要同步github的数据格式示例和推理 | |||
技术细节梳理, 见解分析, 引导理解, 略读文章 | CSDN | ★★★☆☆ | 【论文解读】Qwen2.5 技术报告,非常详细收藏我这一篇就够了 https://blog.csdn.net/2401_85390073/article/details/144727500 | 对论文的总结是比较简略的,通过QnA问答的方式帮助读者理解 | |||