Milestone LLM Papers

2025-02-04 09:39


Awesome-LLM Milestone Papers: explore LLM's history and state-of-the-art


Paper Name

Paper Keywords

Article Category

Source

Rating

Resources

Note

1

Attention Is All You Need( https://arxiv.org/pdf/1706.03762


- Source Code https://github.com/tensorflow/tensor2tensor/blob/master/tensor2tensor/models/transformer.py (official tensorflow implementation)

- PyTorch implementation of the Transformer model

https://github.com/jadore801120/attention-is-all-you-need-pytorch


这篇论文是LLM入门必读,很多精读文章和视频都写得不错;这里主要选了一些带有相关拓展背景知识的精读,让小白也能轻松get到attention的思想

Transformers

技术细节梳理, 引导理解, 技术点详解, 相关拓展, 见解分析

知乎

★★★★★

【经典精读】万字长文解读Transformer模型和Attention机制

https://zhuanlan.zhihu.com/p/104393915

这篇博客主要是介绍Transformer的,从Transformer和attention的背景开始介绍,对于技术细节的解释很清晰且易懂,文章逻辑通顺

GitHub

★★★★★

The Illustrated Transformer

https://jalammar.github.io/illustrated-transformer/

图文结合的非常详细的介绍

Other

★★★★★

Attention Is All You Need (Transformer) 论文精读

https://zhouyifan.net/2022/11/12/20220925-Transformer/

补充背景知识的部分让论文更好理解,全文讲解过程也用了很多简单的实际例子来介绍抽象概念,对于论文的精读是有重点的

CSDN

★★★★★

【Transformer系列(3)】 《Attention Is All You Need》论文超详细解读(翻译+精读)

https://blog.csdn.net/weixin_43334693/article/details/130208816

这篇博客是一个系列:从encoder&decoder,到attention,论文和transformer一步一步深入解读。这篇精读也包括翻译+精读部分帮助理解

技术细节梳理, 引导理解, 相关拓展, 见解分析

CSDN

★★★★★

Transformer通俗笔记:从Word2Vec、Seq2Seq逐步理解到GPT、BERT

https://blog.csdn.net/v_JULY_v/article/details/127411638

可以看出作者很有思想,文章介绍了一系列的预训练模型,通俗易懂的带领读者理解透彻该模型的目的

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

《Attention Is All You Need》论文解读

https://www.bilibili.com/video/BV1pr421t73G/

深入浅出的精读论文,讲解的时候加入了一些例子,对小白很友好

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

Transformer论文逐段精读【论文精读】

https://www.bilibili.com/video/BV1pu411o7BE/

逐段精读,评论区有一些笔记以及补充知识

引导理解, 代码解析

知乎

★★★★☆

Transformer 零基础解析教程,完整版代码最终挑战(4/4)

https://zhuanlan.zhihu.com/p/609535959

解析了原文代码;这篇文章也是系列解读中的一篇,同系列解读也很不错,但是需要一些基础

2

Improving Language Understanding

by Generative Pre-Training

https://www.cs.ubc.ca/~amuham01/LING530/papers/radford2018improving.pdf


- Unofficial Pytorch Implementation

https://github.com/akshat0123/GPT-1

GPT 1.0

技术细节梳理, 引导理解, 技术点详解, 相关拓展, 见解分析

CSDN

★★★★★

ChatGPT技术原理解析:从RL之PPO算法、RLHF到GPT4、instructGPT

https://blog.csdn.net/v_JULY_v/article/details/128579457

这篇文章写清楚了ChatGPT背后的所有关键细节,分为好几个部分,用通俗易懂的语言解释抽象概念

技术细节梳理, 引导理解, 技术点详解, 代码解析

CSDN

★★★★☆

GPT1:Improving Language Understanding by Generative Pre-Training

https://blog.csdn.net/sinat_34461199/article/details/135404779

这篇博客的逻辑很通顺,简要介绍了背景和创新点,然后仔细分析了GPTv1的实现,简要分析了代码

技术细节梳理, 引导理解, 技术点详解

CSDN

★★★★★

GPT-1原理-Improving Language Understanding by Generative Pre-Training

https://blog.csdn.net/weixin_41885239/article/details/137119048

这篇博客记录了博主对论文的理解和见解,用通俗的语言解释论文的动机,猜想,结构,微调,最后还总结了一些缺陷

精读视频, 引导理解, 见解分析

Bilibili

★★★★★

[论文简析]Improving fine-grained understanding in image-text pre-training[2401.0986]

https://www.bilibili.com/video/BV15A4m1G7zj/

清晰流畅的精读视频,虽然不是一句一句带读论文,但是能够get到重点

相关拓展

CSDN

★★★☆☆

GPTv1,2,3

https://blog.csdn.net/NINJA_xu/article/details/120955675

简单总结对比了GPT v1, v2, v3,感觉很适合放在课件里做一个对比讲解

3

BERT: Pre-training of Deep Bidirectional Transformers for

Language Understanding

https://aclanthology.org/N19-1423.pdf


- Source Code

https://github.com/google-research/bert

BERT, Transformers

精读视频, 见解分析, 引导理解, 技术点详解

Bilibili

★★★★★

BERT 论文逐段精读【论文精读】

https://www.bilibili.com/video/BV1PL411M7eQ/

李沐老师的逐段精读,非常清晰

技术细节梳理, 引导理解

CSDN

★★★★★

【李沐论文精读】BERT精读

https://blog.csdn.net/qq_45276194/article/details/136505370

根据李沐老师的精读视频总结的精读笔记;中间有一些读论文中的问题以及回答,顺着逻辑更好理解论文

技术细节梳理, 引导理解, 见解分析

知乎

★★★★★

读懂BERT,看这一篇就够了

https://zhuanlan.zhihu.com/p/403495863

非常细致的精读,其中还包括一个思维导图,对每个部分的解读都非常详细易懂

技术细节梳理, 引导理解, 见解分析

CSDN

★★★★★

【论文精读】BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

https://blog.csdn.net/weixin_46803857/article/details/129008322

很精致的阅读笔记,对论文的每一部分都有全面的翻译,重点标注和总结,最后有博主的一些个人观点

代码复现, 论文开源项目教程, 相关拓展, 代码解析, 技术点详解, 模型使用教程

博客园

★★★★★

基于bert-base-chinese训练bert模型(最后附上整体代码)

https://www.cnblogs.com/zrold/p/17654254.html

提供数据集,基于bert-base-chinese模型训练一个BERT模型的教程,提供了一些讲解以及代码详细解析

引导理解, 代码解析

GitHub

★★★★★

BERT-Easy-Tutorial

https://github.com/chenaoxuan/BERT-Easy-Tutorial/blob/master/docs/README_ZH.md

对于BERT代码的详细解析

技术细节梳理

微信

★★★★☆

大模型必读系列01:BERT精读笔记

https://mp.weixin.qq.com/s/KX0DS5zMo8cVP1tYEuSf-g

比较中规中矩的精读文章

论文开源项目教程

博客园

★★★☆☆

BERT初体验:谷歌开源bert环境配置(Win10)

https://www.cnblogs.com/xishufan/p/14332275.html

安装package后运行开源代码的教程,比较简洁

4

Language Models are Unsupervised Multitask Learners

https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf


- Source code

https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf

GPT2.0

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

GPT,GPT-2,GPT-3 论文精读【论文精读】

https://www.bilibili.com/video/BV1AF411b7xQ/

李沐老师逐段精读三片论文

精读视频, 见解分析, 引导理解, 代码解析

Bilibili

★★★★★

72、爆火的GPT-2论文讲解

https://www.bilibili.com/video/BV1Ma4y1R72i/

逐段讲解了的GPT-2论文,并提供了一些自己的思考

代码复现

CSDN

★★★★☆

GPT2训练自己的对话问答机器人

https://blog.csdn.net/weixin_38226321/article/details/130046504

基于GPT2的中文闲聊机器人,模型实现基于HuggingFace的transformers, 精读GPT2-Chinese的论文和代码,参考了https://github.com/yangjianxin1/GPT2-chitchat

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★☆

GPT2.0 Language Models are Unsupervised Multitask Learners 论文解读

https://blog.csdn.net/u012526436/article/details/87882985

文中有博主的个人见解,但是整篇文章是偏翻译的解读

技术细节梳理

知乎

★★★☆☆

【论文精读】GPT2

https://zhuanlan.zhihu.com/p/682063298

对论文的核心方法和实验部分详解

技术细节梳理

知乎

★★★☆☆

【论文阅读】GPT 2: Language Models are Unsupervised Multitask Learners

https://zhuanlan.zhihu.com/p/12116904158

逻辑比较清晰的总结精读

5

Megatron-LM: Training Multi-Billion Parameter Language Models Using

Model Parallelism

https://arxiv.org/pdf/1909.08053


- Source Code

https://github.com/NVIDIA/Megatron-LM

- Official Presentation slides

https://developer.download.nvidia.com/video/gputechconf/gtc/2020/presentations/s21496-megatron-lm-training-multi-billion-parameter-language-models-using-model-parallelism.pdf

Transformers, tensor, Pytorch, Megatron

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

Megatron LM 论文精读【论文精读】

https://www.bilibili.com/video/BV1nB4y1R7Yz/

李沐老师逐段带读

技术细节梳理, 技术点详解

知乎

★★★★★

深入理解 Megatron-LM(1)基础知识

https://zhuanlan.zhihu.com/p/650234985

这是一个系列文章中的第一篇,后面几篇在文章结尾有链接,是更加深入的细节解读,非常干活

技术细节梳理, 技术点详解

CSDN

★★★★☆

详解MegatronLM Tensor模型并行训练(Tensor Parallel)

https://blog.csdn.net/qinduohao333/article/details/131617757

详细介绍了论文中用到的方法,论文比较硬核,稍微有点抽象

技术点详解

知乎

★★★★☆

读论文《Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism 》

https://zhuanlan.zhihu.com/p/460490943

对于技术的详解,没有梳理论文,主要关注了重点的技术创新点

模型使用教程

知乎

★★★★☆

如何使用 Megatron-LM 训练语言模型

https://zhuanlan.zhihu.com/p/633160974

分析了该模型与GPT2.0的不同之处,介绍如何使用 Megatron-LM框架训练

代码解析

Other

★★★★★

Megatron-LM源码系列(六):Distributed-Optimizer分布式优化器实现Part1

https://www.mltalks.com/posts/3749485165/

介绍了模型的实现和代码解读

6

Exploring the Limits of Transfer Learning with a Unified

Text-to-Text Transformer

https://jmlr.org/papers/volume21/20-074/20-074.pdf


- Source Code

https://github.com/google-research/text-to-text-transfer-transformer

Transformers, T5

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

论文阅读之Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(2020)

https://blog.csdn.net/qq_52785473/article/details/130517277

这篇博客的作者一段一段分析解释论文,带领读者理解,选出其中比较有意思的部分重点讲解,有自己的思考

精读视频, 引导理解

Bilibili

★★★★★

半小时学透万能大模型:谷歌T5模型结构和原理!一个大一统的NLP处理框架T5打破Few-shot Learning的次元壁垒!预训练模型

https://www.bilibili.com/video/BV1bk4y1Q7xd

很通透的精读视频,会用一些通俗的例子来解释,ppt做的也不错

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★☆

T5论文笔记(Text-To-Text Transfer Transformer)

https://blog.csdn.net/u014596913/article/details/134279584

精读文章,不是纯翻译,比较通俗易懂

模型使用教程, 模型实战

CSDN

★★★★☆

NLP实践——以T5模型为例训练seq2seq模型

https://blog.csdn.net/weixin_44826203/article/details/126295253

以T5为例,介绍如何利用transformers模块搭建生成式模型,并训练seq2seq生成模型

模型实战

代码先锋网

★★★★☆

NLP:T5模型实战(on BoolQ)

https://www.codeleading.com/article/84084387459/

T5实战的教程,用T5实现binary_classification

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★☆

T5:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(万字长文略解T5)

https://blog.csdn.net/qq_38901850/article/details/126177194

比较全面的精读,有点偏翻译

技术细节梳理, 见解分析, 引导理解

CSDN

★★★☆☆

文献阅读笔记:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5)

https://blog.csdn.net/ljp1919/article/details/102956381

略读文章, 见解分析, 引导理解, 知乎讨论

知乎

★★★☆☆

T5 模型:NLP Text-to-Text 预训练模型超大规模探索

https://zhuanlan.zhihu.com/p/88438851

比较简单通俗易懂的介绍

引导理解

Bilibili

★★★☆☆

半小时学透万能大模型:谷歌T5模型结构和原理!一个大一统的NLP处理框架T5打破Few-shot Learning的次元壁垒!预训练模型

https://www.bilibili.com/video/BV1bk4y1Q7xd/

快速理解T5模型的视频,需要有一定的background knowledge

代码解析

知乎

★★★☆☆

huggingface t5代码解读

https://zhuanlan.zhihu.com/p/647802200

对于T5模型的代码详解,对实现模型很有帮助

略读文章, 引导理解

知乎

★★☆☆☆

预训练(2):T5语言模型论文讲解

https://zhuanlan.zhihu.com/p/620132282

逻辑清晰,用自己的语言总结介绍了模型结构和实验,有楼主自己的思考和见解

略读文章, 相关拓展

知乎

★★☆☆☆

大模型 | T5 vs BERT vs GPT

https://zhuanlan.zhihu.com/p/664143604

关于大模型各个方面的对比

7

ZeRO: Memory Optimizations Toward Training Trillion

Parameter Models

https://arxiv.org/pdf/1910.02054


- ZeRO is shared as a part of open source DL training optimization library — DeepSpeed

- Source Code

https://github.com/microsoft/deepspeed

- DeepSpeed Website

https://github.com/microsoft/deepspeed

ZeRO

精读视频, 引导理解, 见解分析, 技术点详解

Bilibili

★★★★★

Zero 论文精读【论文精读】

https://www.bilibili.com/video/BV1tY411g7ZT/

李沐老师的逐段精读

技术细节梳理, 引导理解, 相关拓展

知乎

★★★★★

ZeRO: Zero Redundancy Optimizer,一篇就够了。

https://zhuanlan.zhihu.com/p/663517415

博主在阅读了很多精读笔记的基础上总结出的更为详细全面的精读,确实是涵盖了很多知识点,语言也很通俗易懂,一步一步带着读者理解

模型实战, 技术细节梳理, 技术点详解

博客园

★★★★★

DeepSpeed 学习 [2]: 从 0 开始 DeepSpeed 实战

https://www.cnblogs.com/Last--Whisper/p/17939371

和现有的tutorial相比,从初学者的视角并且关于一些容易 confused 的地方进行一定程度的 follow up

先进行一些 DDP 的铺垫,防止后续的内容引出突兀;一步一步深入理解代码和配置

技术细节梳理, 见解分析, 引导理解, 技术点详解

CSDN

★★★★★

[论文笔记]ZeRO: Memory Optimizations Toward Training Trillion Parameter Models

https://blog.csdn.net/yjw123456/article/details/141231830

非常详细全面的解读,带领读者理解论文的细节

ZeRO论文精读

https://blog.csdn.net/qq_41624557/article/details/138971204

Youtube

★★★★★

Turing-NLG, DeepSpeed and the ZeRO optimizer

https://www.youtube.com/watch?v=tC01FRB0M7w

很清晰的overview,介绍了ZeRO的原理

8

Scaling Laws for Neural Language Models

https://arxiv.org/pdf/2001.08361


- Source Code

https://github.com/shehper/scaling_laws

Scaling Law

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★☆

LLM:Scaling Laws for Neural Language Models (上)

https://blog.csdn.net/lilai619/article/details/135535030

写的非常详细并且引导理解的系列解读,但是中和下需要付费会员

LLM:Scaling Laws for Neural Language Models (中)

https://blog.csdn.net/lilai619/article/details/135601415

LLM:Training Compute-Optimal Large Language Models(下)

https://blog.csdn.net/lilai619/article/details/135624041

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

OpenAI的Scaling Law论文笔记

https://blog.csdn.net/Rising_shit/article/details/141929975

博主自己的理解贯穿全文,通俗易懂

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

【论文阅读】Scaling Laws for Neural Language Models(2020)- 大模型预训练参数量、数据集大小、计算资源之间的关系验证

https://blog.csdn.net/weixin_36488653/article/details/140120350

逻辑和讲解都很清晰,先说结论,然后详解定律

略读文章, 引导理解, 见解分析

知乎

★★★★☆

Scaling Laws for Neural Language Models

https://zhuanlan.zhihu.com/p/620479884

清晰易懂的总结,比较简要

见解分析

知乎

★★★☆☆

Comments | Scaling Laws for Neural Language Models

https://zhuanlan.zhihu.com/p/116105022

主要是对论文提出了一些自己的看法和见解

翻译式解读

知乎

★★★☆☆

【大模型】Scaling Laws for Neural Language Models

https://zhuanlan.zhihu.com/p/665810769

论文翻译

9

Language Models are Few-Shot Learners

https://papers.nips.cc/paper/2020/file/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf


- Source Code

https://github.com/openai/gpt-3

GPT3.0

技术细节梳理, 引导理解

CSDN

★★★★☆

【论文笔记】Language Models are Few-Shot Learners B部分

https://blog.csdn.net/m0_48948682/article/details/138291570

先回顾GPT1和2,然后一段一段精读论文,标注重点

见解分析, 翻译式解读

CSDN

★★★★★

人工智能论文GPT-3(1):2020.5 Language Models are Few-Shot Learners;摘要;引言;scaling-law

https://blog.csdn.net/ank1983/article/details/137836482

分为五个部分非常细致的翻译,每部分结尾有博主自己的思考和评论

人工智能论文GPT-3(2):2020.5 Language Models are Few-Shot Learners;微调;少样本Few-Shot (FS)

https://blog.csdn.net/ank1983/article/details/137981350

人工智能论文GPT-3(3):2020.5 Language Models are Few-Shot Learners;架构;训练数据集;开源

https://blog.csdn.net/ank1983/article/details/138014539

人工智能论文GPT-3(4):2020.5 Language Models are Few-Shot Learners;结果;局限性;结果报告而非论文

https://blog.csdn.net/ank1983/article/details/138039593

人工智能论文GPT-3(5):2020.5 Language Models are Few-Shot Learners;总结

https://blog.csdn.net/ank1983/article/details/138094795

10

Switch Transformers: Scaling to Trillion Parameter Models

with Simple and Efficient Sparsity

https://arxiv.org/pdf/2101.03961


- Source Code

https://github.com/google-research/t5x

- Tensorflow Implementation

https://github.com/tensorflow/mesh/blob/master/mesh_tensorflow/transformer/moe.py

Switch Transformers

技术细节梳理, 见解分析, 引导理解, 技术点详解

Other

★★★★★

MOE论文详解(3)-Switch Transformers:Scaling to Trillion Parameter Models with Simple and Efficient Sparsity

https://www.mltalks.com/posts/1542132413/

总结得比较清晰的精读,通俗易懂

见解分析, 引导理解

博客园

★★★★★

【译】稀疏混合专家模型的崛起: Switch Transformers

https://www.cnblogs.com/Leap-abead/p/18021972

写得很通俗易懂的文章,看完就能了解论文的核心部分

技术细节梳理, 引导理解, 技术点详解

CSDN

★★★★★

深入解读首个万亿级语言模型Switch Transformer

https://blog.csdn.net/c9Yv2cf9I06K2A9E/article/details/116177508

很全面,比较中规中矩

技术细节梳理, 引导理解, 技术点详解

知乎

★★★★★

Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity 精度与翻译

https://zhuanlan.zhihu.com/p/672966802

精读+翻译

技术细节梳理, 引导理解, 技术点详解

CSDN

★★★★☆

谷歌新语言模型Switch Transformer

https://blog.csdn.net/deephub/article/details/113241477

主要对模型的架构进行了详细解读

见解分析, 引导理解

知乎

★★★★☆

Switch Transformer: 高效稀疏的万亿参数Transformer

https://zhuanlan.zhihu.com/p/352462938

博主用自己的理解记录下的相关知识点,不是特别细致,需要一些前置知识

略读文章, 模型实战, 相关拓展, 代码解析

知乎

★★★★★

Switch Transformer:MoE+Transformer 分本分类案例(Keras + PyTorch)

https://zhuanlan.zhihu.com/p/705443412

展示了 Switch Transformer (Fedus et al., 2021)模型在文本分类中的实现,对代码有一些解读

11

Evaluating Large Language Models Trained on Code

https://arxiv.org/pdf/2107.03374


- Source Code

https://github.com/openai/human-eval

Codex

精读视频, 见解分析, 引导理解, 技术点详解

Bilibili

★★★★★

OpenAI Codex 论文精读【论文精读】

https://www.bilibili.com/video/BV1iY41137Zi/

李沐老师的逐段论文精读

略读文章, 相关拓展

CSDN

★★★★☆

ChatGPT的朋友们:大语言模型经典论文一次读到吐

https://blog.csdn.net/weixin_36896856/article/details/130776264

对ChatGPT相关的论文的简要略读,放在一起可以直观看到各个模型的进化史

相关拓展, 知乎讨论

知乎

★★★☆☆

ChatGPT 已经对程序员造成了什么影响?

https://www.zhihu.com/question/579037511/answer/2954436580

关于AI coding的一些讨论

12

On the Opportunities and Risks of

Foundation Models

https://arxiv.org/pdf/2108.07258


- Source Code

https://github.com/PBusienei/Opportunities-and-Risks-of-Foundation-Models

Foundation Models

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

斯坦福两百页论文讨论《基础模型(GPT3, DALL-E等)的风险和机会》 Opportunities/Risks of Foundation Models

https://www.bilibili.com/video/BV1FQ4y1172e

这篇论文非常长分了很多部分,这个视频介绍了论文的主要观点和核心思想

技术细节梳理, 见解分析, 引导理解, 技术点详解

CSDN

★★★★★

【深度学习:Foundation Models】基础模型完整指南

https://blog.csdn.net/jcfszxc/article/details/135486014

讲的很透彻的精读,总结了论文的核心部分

技术细节梳理, 见解分析, 引导理解

知乎

★★★★☆

[论文分享]On the Opportunities and Risks of Foundation Models

https://zhuanlan.zhihu.com/p/519403998

本文翻译了原文中的部分章节,对于大部分引用的出处、内容,以及一些详细的分析和推论并没有深入了解,盖因原文太长所致。


对于不熟悉大模型领域知识的相关人员,本文能够抛砖引玉,对于大模型技术的前世今生进行一个深入浅出的介绍

相关拓展, 代码解析

知乎

★★★☆☆

ChatGPT 有多高的技术壁垒?国内外除了 OpenAI 还有谁可以做到类似程度?

https://www.zhihu.com/question/581806122/answer/2882441759

虽然不是精读,但是是一个值得思考的问题

13

Finetuned Language Models are Zero-Shot Learners

https://openreview.net/pdf?id=gEZrGCozdqR


- Source Code

https://github.com/google-research/flan

FLAN

技术细节梳理, 见解分析, 引导理解

知乎

★★★★★

Finetuned Language Models are Zero-shot Learners

https://zhuanlan.zhihu.com/p/538013856

较为全面的精读,语言也比较通俗易懂

【LLM系列-04】Finetuned Language Models Are Zero-Shot Learners

https://zhuanlan.zhihu.com/p/607657048

相关拓展

知乎

★★★★☆

Instruction Finetune

https://zhuanlan.zhihu.com/p/631342824

虽然不是论文的精读,但是概括了几篇比较有名的论文来探讨prompt engineering和Instruction Finetune,分析得也很易懂清晰

技术细节梳理, 翻译式解读

CSDN

★★★★☆

【论文阅读】Finetuned Language Models Are Zero-Shot Learners

https://blog.csdn.net/qq_52852138/article/details/127135860

偏翻译的精读

精读视频, 见解分析, 引导理解

Bilibili

★★★★☆

语言模型是小样本学习者 (Language Models are Few-Shot Learners) - GPT-3

https://www.bilibili.com/video/BV1S54y1m7p5/

比较清晰流畅的精读视频,用一个ppt来总结论文每个部分,不是逐段精读

略读文章, 见解分析

CSDN

★★★☆☆

文献阅读:Finetuned Language Models Are Zero-Shot Learners

https://blog.csdn.net/codename_cys/article/details/128994708

简单介绍了一下论文的方法和实验,发表了一些读者自己的看法

别再Prompt了!谷歌提出tuning新方法,强力释放GPT-3潜力!

https://blog.csdn.net/xixiaoyaoww/article/details/120170453

14

Multitask Prompted Training Enables Zero-Shot Task Generalization

https://arxiv.org/pdf/2110.08207


- Source Code for trained models

https://github.com/bigscience-workshop/t-zero

- Source Code for prompts

https://github.com/bigscience-workshop/promptsource

T0

技术细节梳理, 引导理解

知乎

★★★★★

【LLM系列-06】Multitask Prompted Training Enables Zero-Shot Task Generalization

https://zhuanlan.zhihu.com/p/615695058

总结精读了论文的各个section

技术细节梳理, 引导理解

CSDN

★★★★☆

【论文阅读】Multitask Prompted Training Enables Zero-shot Task Generalization

https://blog.csdn.net/qq_52852138/article/details/127189211

中规中矩的精读文章

略读文章, 相关拓展

知乎

★★★★☆

打开模型Zero-Shot新范式:Instruction Tuning

https://zhuanlan.zhihu.com/p/558286175

对instruction tuning相关论文的串联解读,很好的知识拓展总结

15

GLaM: Efficient Scaling of Language Models with Mixture-of-Experts

https://arxiv.org/pdf/2112.06905


- No Source Code

GLaM

技术细节梳理, 见解分析, 引导理解, 技术点详解

腾讯云

★★★★★

1.2万亿参数:谷歌通用稀疏语言模型GLaM,小样本学习打败GPT-3

https://cloud.tencent.com/developer/article/1917572

详细精读了模型架构和实验结果

技术细节梳理, 相关拓展, 引导理解

博客园

★★★★★

GPT-3被超越?解读低能耗、高性能的GlaM模型

https://www.cnblogs.com/NLPlunwenjiedu/p/15978076.html

从背景知识逐步引导读者理解,逻辑清晰

略读文章, 相关拓展

CSDN

★★★★☆

稀疏大模型简述:从MoE、Sparse Attention到GLaM

https://blog.csdn.net/xixiaoyaoww/article/details/123675675

概括了三篇论文的核心,从三个方面叙述了不同模型/论文的focus

相关拓展

HuggingFace

★★★☆☆

Mixture of Experts Explained

https://huggingface.co/blog/moe

关于Mixture-of-Experts的比较全面的介绍

16

WebGPT: Browser-assisted question-answering with human feedback

https://www.semanticscholar.org/reader/2f3efe44083af91cef562c1a3451eee2f8601d22


- Open-sourced Microsoft Bing Web Search API

https://www.microsoft.com/en-us/bing/apis/bing-web-search-api

WebGPT

技术细节梳理, 相关拓展, 引导理解, 精读视频

Bilibili

★★★★★

2023 - 李宏毅 - 生成式模型的两种策略 + 能够使用工具的WebGPT

https://www.bilibili.com/video/BV1K24y1c79m

lecture的一个节选,讲的非常好很连贯,用简单易懂的例子帮助理解

技术细节梳理, 相关拓展, 引导理解, 精读视频

Bilibili

★★★★★

台大陈蕴侬老师带你理清【ChatGPT】对话机器人的前世今生,从InstructGPT到WebGPT,快速搞定难懂知识点!!!ChatGPT注册|对话机器人

https://www.bilibili.com/video/BV1Bx4y1V73T

一共三个视频包括了InstrcutGPT, ChatGPT和WebGPT,清晰易懂

技术细节梳理, 精读视频, 见解分析, 引导理解

Bilibili

★★★★★

你不该错过的论文:New Bing背后的技术WebGPT//一起来读论文吧

https://www.bilibili.com/video/BV1M84y1P73V/

带领读者读论文的精读视频,讲的很清楚

技术细节梳理, 引导理解, 技术点详解

CSDN

★★★★★

自然语言处理】【ChatGPT系列】WebGPT:基于人类反馈的浏览器辅助问答

https://blog.csdn.net/bqw18744018044/article/details/128570804

比较细致的论文精读

技术细节梳理, 见解分析, 引导理解, 略读文章

CSDN

★★★★★

论文 | WebGPT: Browser-assisted question-answering with human feedback

https://blog.csdn.net/m0_49651195/article/details/139969440

不算特别详细,但是比较通俗易懂

技术细节梳理, 见解分析, 引导理解, 略读文章

Other

★★★★☆

WebGPT 简读

https://finisky.github.io/webgpt-summary/

有一些个人见解的技术点总结,快速抓住论文核心要点

17

Improving language models by retrieving from trillions of tokens

https://arxiv.org/pdf/2112.04426


- Pytorch implementation (Unofficial)

https://github.com/lucidrains/RETRO-pytorch?tab=readme-ov-file

Retro

技术细节梳理, 见解分析, 引导理解, 精读视频

Youtube

★★★★★

The Illustrated Retrieval Transformer (video)

https://www.youtube.com/watch?v=sMPq4cVS4kg

The Illustrated Retrieval Transformer (blog)

http://jalammar.github.io/illustrated-retrieval-transformer/

很清晰的讲解,以图文结合的方式帮助理解

技术细节梳理, 见解分析, 引导理解, 技术点详解

知乎

★★★★★

RETRO: Improving language models by retrieving from trillions of tokens

https://zhuanlan.zhihu.com/p/656193383

主要结合论文介绍了训练数据和模型结构,讲解得比较深入

技术细节梳理, 引导理解, 技术点详解

博客园

★★★★★

以小25倍参数量媲美GPT-3的检索增强自回归语言模型:RETRO

https://www.cnblogs.com/NLPlunwenjiedu/p/15960702.html


模型使用教程, 代码解析

懂AI

★★★★★

RETRO-pytorch

https://www.dongaigc.com/p/lucidrains/RETRO-pytorch

RETRO-pytorch是一个基于PyTorch实现的检索增强变换器(RETRO)模型,博客是运行教程

技术细节梳理, 见解分析, 引导理解

知乎

★★★★☆

Improving language models by retrieving from trillions of tokens

https://zhuanlan.zhihu.com/p/694835522

逻辑清晰的从几个section总结精读论文,不是特别详尽

代码解析

Other

★★★☆☆

RETRO 训练数据集

https://nn.labml.ai/zh/transformers/retro/dataset.html

RETRO训练dataset的代码详解

18

Scaling Language Models: Methods, Analysis

& Insights from Training Gopher

https://arxiv.org/pdf/2112.11446


- No Source Code

Gopher

技术细节梳理, 引导理解, 技术点详解, 翻译式解读

CSDN

★★★★★

LLMs之Gopher/Chinchilla:《Training Compute-Optimal Large Language Models》的翻译与解读

https://blog.csdn.net/qq_41185868/article/details/124239536

非常细致全面的逐段翻译精读

19

Chain-of-Thought Prompting Elicits Reasoning

in Large Language Models

https://arxiv.org/pdf/2201.11903

CoT

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

Chain of Thought论文、代码和资源【论文精读·43】

https://www.bilibili.com/video/BV1t8411e7Ug/

带着读者一步一步理解context,逐段精读论文,娓娓道来,非常清楚

技术细节梳理, 引导理解, 见解分析, 技术点详解

知乎

★★★★★

CoT开山之作:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 论文解读

https://zhuanlan.zhihu.com/p/617594574

比较中规中矩的精读文章,总结了论文各个部分的内容

技术细节梳理, 引导理解, 见解分析, 技术点详解

CSDN

★★★★★

大模型思维链论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》简要介绍

https://blog.csdn.net/qq_37261357/article/details/137346042

可以看出博主写文章的思考,提出需要读者关注的问题,解析相关技术知识,最后有一个思维导图

相关拓展, 见解分析, 技术点详解

知乎

★★★★★

一文读懂:大模型的思维链 CoT(Chain of Thought)

https://zhuanlan.zhihu.com/p/670907685

对CoT的详尽介绍,延伸到了以后的发展和其他应用领域如agent

相关拓展, 见解分析, 技术点详解

CSDN

★★★★☆

大模型思维链(Chain-of-Thought)技术原理

https://blog.csdn.net/2401_85343303/article/details/144238140

介绍了 CoT 以及后续的改进,从背景知识开始带着读者理解prompt到CoT的演变史,拓展了一整条发展链条,逻辑很清楚

技术细节梳理, 相关拓展, 见解分析, 技术点详解

知乎

★★★☆☆

Chain of Thought 开山之作论文详解

https://zhuanlan.zhihu.com/p/582758381

介绍了三篇CoT相关的论文,串在一起一步一步深入,讲解得比较透彻

★★★☆☆

解锁LLMs的“思考”能力:Chain-of-Thought(CoT) 技术推动复杂推理的新发展

https://zhuanlan.zhihu.com/p/703881352

20

LaMDA: Language Models for Dialog Applications

https://arxiv.org/pdf/2201.08239


- Source Code

https://github.com/conceptofmind/LaMDA-rlhf-pytorch

LaMDA

技术细节梳理, 引导理解

知乎

★★★★★

对话机器人之LaMDA

https://zhuanlan.zhihu.com/p/590868833

精读了文章的核心部分,比较通俗易懂

略读文章, 见解分析

CSDN

★★☆☆☆

文献阅读:LaMDA: Language Models for Dialog Applications

https://blog.csdn.net/codename_cys/article/details/130544821

总结了论文的具体工作,但是并不是特别细致的精读,加入了一些博主的个人见解

相关拓展, 见解分析

知乎

★★☆☆☆

谷歌LaMDA|工业级端到端预训练对话模型

https://zhuanlan.zhihu.com/p/462022601

非论文精读文章,主要是博主对于打造实际能用的对话产品的看法,以及LaMDA模型在对话任务中利用LLM的启发

21

Solving Quantitative Reasoning Problems with Language Models

https://arxiv.org/pdf/2206.14858


- Unofficial Implementation in Pytorch

https://github.com/kyegomez/Minerva

Minerva

技术细节梳理, 引导理解

Other

★★★★☆

Minerva: A Breakthrough in Quantitative Reasoning for Language Models

https://www.33rdsquare.com/minerva-googles-language-model-for-quantitative-reasoning/

以比较通俗的语言总结了论文的各个section

略读文章, 见解分析

知乎

★★★☆☆

谷歌 AI 开发深度学习模型 Minerva,解决数学定量推理问题

https://zhuanlan.zhihu.com/p/548458130

简单介绍了模型的架构和性能

22

Using DeepSpeed and Megatron to Train Megatron-Turing NLG

530B, A Large-Scale Generative Language Model

https://arxiv.org/pdf/2201.11990

Megatron-Turing NLG, DeepSpeed, Megatron

引导理解, 作者presentation

Microsoft

★★★☆☆

Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, the World’s Largest and Most Powerful Generative Language Model

https://www.microsoft.com/en-us/research/blog/using-deepspeed-and-megatron-to-train-megatron-turing-nlg-530b-the-worlds-largest-and-most-powerful-generative-language-model/

官方博客,总结了论文的主要内容,比较像这篇论文的presentation

略读文章, 见解分析

知乎

★★☆☆☆

5300亿NLP模型“威震天-图灵”发布,由4480块A100训练,微软英伟达联合出品

https://zhuanlan.zhihu.com/p/420544116

这篇论文的本质就是用很多英伟达GPU和微软分布式学习系统训练一个超大模型,可以作为了解,

23

Training language models to follow instructions

with human feedback

https://arxiv.org/pdf/2203.02155


- Source Code

https://github.com/openai/following-instructions-human-feedback


这篇也是LLM里程碑式的一步,有很多精读笔记和翻译

GPT3.0, InstructGPT

精读视频, 见解分析, 引导理解, 技术点详解

Bilibili

★★★★★

InstructGPT 论文精读【论文精读·48】

https://www.bilibili.com/video/BV1hd4y187CR/

李沐老师逐段精读

技术细节梳理, 见解分析, 引导理解, 翻译式解读

CSDN

★★★★★

Training language models to follow instructions with human feedback

https://blog.csdn.net/m0_59402094/article/details/137936097

虽然博客的结构看起来稍微有点乱,但是基本是将原文重点列出来然后再翻译,逐段精读讲解,还是比较易懂的

技术细节梳理, 相关拓展, 见解分析, 引导理解

知乎

★★★★★

ChatGPT/InstructGPT详解

https://zhuanlan.zhihu.com/p/590311003

介绍了一系列背景知识,以及InstructGPT/ChatGPT原理非常详细的解读,逻辑清晰,讲解清晰易懂

技术细节梳理, 引导理解, 见解分析, 翻译式解读

CSDN

★★★★★

【论文笔记】Training language models to follow instructions with human feedback A部分

https://blog.csdn.net/m0_48948682/article/details/138350055

【论文笔记】Training language models to follow instructions with human feedback B部分

https://blog.csdn.net/m0_48948682/article/details/138475773

基本是翻译精读,有一些重点标注,articulation也不是特别机翻,很全面

技术细节梳理, 引导理解

CSDN

★★★☆☆

【大模型】Instruct GPT :Training language models to follow instructions with human feedback

https://blog.csdn.net/weixin_42018581/article/details/142152277

精读笔记,对论文各个部分进行概述

24

PaLM: Scaling Language Modeling with Pathways

https://arxiv.org/pdf/2204.02311


- Source Code

https://github.com/conceptofmind/PaLM

PaLM

代码复现

GitHub

★★★★★

https://github.com/lucidrains/PaLM-rlhf-pytorch

Implementation of RLHF (Reinforcement Learning with Human Feedback) on top of the PaLM architecture. Basically ChatGPT but with PaLM

技术细节梳理, 引导理解, 技术点详解

CSDN

★★★★★

【自然语言处理】【大模型】PaLM:基于Pathways的大语言模型

https://blog.csdn.net/bqw18744018044/article/details/128809221

论文精读,对每个部分都概括总结

略读文章, 见解分析, 技术点详解

知乎

★★★★★

聊聊谷歌的超级大模型PaLM: Scaling Language Modeling with Pathways

https://zhuanlan.zhihu.com/p/495287288

简单总结了论文内容,中间也穿插着自己的见解,最后提出了自己的感想

翻译式解读

CSDN

★★★☆☆

LLMs:《PaLM: Scaling Language Modeling with Pathways》翻译与解读

https://blog.csdn.net/qq_41185868/article/details/125476444

一段总结性导读+全文逐段翻译

技术细节梳理, 精读视频, 论文开源项目教程, 引导理解, 见解分析

Youtube

★★★☆☆

Google PaLM: Scaling Language Modeling with Pathways

https://www.youtube.com/watch?v=CF-sdpE9IVM

解析模型的结构,performance和应用

25

Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models

https://arxiv.org/pdf/2408.00724


- Source Code

https://github.com/thu-wyz/inference_scaling

Chinchilla, Scaling Law

相关拓展

CSDN

★★★☆☆

大型语言模型的长文本处理能力:压缩与性能的权衡

https://blog.csdn.net/weixin_36829761/article/details/140143865

不是这篇论文的精读,但是是对这个topic的探讨:对多种效率驱动的压缩方法进行全面的基准测试,分析它们在不同长文本任务下的性能表现,并探讨未来长文本处理能力 LLM 的发展方向。

26

OPT: Open Pre-trained Transformer Language Models

https://arxiv.org/pdf/2205.01068


- Source Code

https://github.com/facebookresearch/metaseq

OPT

精读视频, 见解分析, 引导理解, 作者presentation

Youtube

★★★★★

Open Pretrained Transformers - Susan Zhang | Stanford MLSys #77

https://www.youtube.com/watch?v=p9IxoSkvZ-M

Stanford的一个seminar lecture,由论文作者讲解的训练模型的全过程,cover了很多细节

精读视频, 代码解析

Youtube

★★★★★

OPT-175B: Open Pretrained Transformer | ML Coding Series

https://www.youtube.com/watch?v=5RUOrXl3nag

非常详细的代码解析,分了很多section,讲解流畅,step-by-step and in-depth analysis

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

大规模语言模型 -- Meta开源OPT-175B | 谷歌发布Pathways Language Model

https://www.bilibili.com/video/BV1KY411g7ot

带读了repo,offical blog和论文中的重点

翻译式解读

CSDN

★★★★☆

LLMs:《OPT: Open Pre-trained Transformer Language Models》翻译与解读

https://blog.csdn.net/qq_41185868/article/details/126091700

一段总结性导读+全文逐段翻译

知乎讨论, 见解分析

知乎

★★★☆☆

如何评价 Meta AI 发布的 Open Pre-trained Transformer 语言模型?

https://www.zhihu.com/question/531570543/answer/2478352613

一些论文解读和大家对OPT模型的看法

27

Unifying Language Learning Paradigms

https://arxiv.org/pdf/2205.05131v1


- Source Code

https://github.com/google-research/google-research/tree/master/ul2

UL2

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

统一NLP预训练范式 - UL2: Unifying Language Learning Paradigm

https://www.bilibili.com/video/BV1eW4y1r7a5/

详细介绍了模型的结构,精读了论文中的一些创新点,讲解清楚流畅

翻译式解读

简书

★★☆☆☆

UL2:统一语言学习范式

https://www.jianshu.com/p/fc0332bfb77c

论文翻译

28

Emergent Abilities of Large Language Models

https://openreview.net/pdf?id=yzkSU5zdwD

Emergent Abilities

相关拓展, 见解分析, 引导理解

知乎

★★★★★

大语言模型的涌现 Emergent Abilities

https://zhuanlan.zhihu.com/p/672747796

不算精读,但是对概念解释得很通俗易懂

相关拓展, 技术点详解

知乎

★★★★☆

Are Emergent Abilities of Large Language Models a Mirage?

https://zhuanlan.zhihu.com/p/626310734

对emergent ability的技术详解,简单明了

技术点详解, 技术细节梳理

知乎

★★★★☆

【自然语言处理】【ChatGPT系列】大模型的涌现能力

https://zhuanlan.zhihu.com/p/596612842

比较偏翻译的精读,很详细

知乎讨论, 见解分析, 略读文章

知乎

★★★☆☆

大模型的涌现能力(Emergent Abilities of LLM)

https://zhuanlan.zhihu.com/p/609339534

比较简单明了

技术细节梳理, 引导理解, 翻译式解读

知乎

★★★☆☆

[大语言模型的涌现能力]Emergent Abilities of Large Language Models(2022)

https://zhuanlan.zhihu.com/p/621777221

比较中规中矩的精读,这篇论文我自己感觉有点抽象,这篇解读不算特别好懂

29

Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models

https://arxiv.org/pdf/2206.04615


- Source Code

https://github.com/google/BIG-bench

BIG-bench

模型使用教程, 略读文章

CSDN

★★★☆☆

NLP:BIG-bench基准任务的简介、安装、使用方法之详细攻略

https://blog.csdn.net/qq_41185868/article/details/130514316


BIG-Bench Hard 数据集分享

https://blog.csdn.net/yinizhilianlove/article/details/136782036

模型的简介及使用教程

相关拓展, 引导理解

知乎

★★★★★

Google研究人员推出大模型新基准BIG-Bench,442位作者提出204项任务,可测量模型行为并完成需求预测

https://zhuanlan.zhihu.com/p/530746810

介绍了论文提出的背景,很有用的背景知识,简单总结了论文的研究结果

30

Language Models are General-Purpose Interfaces

https://arxiv.org/pdf/2206.06336


- Source Code

https://github.com/microsoft/unilm

METALM

精读视频, 见解分析, 引导理解, 相关拓展

Youtube

★★★★★

Harvard Medical AI: Jon Williams on "Language Models are General-Purpose Interfaces"

https://www.youtube.com/watch?v=oi-Xnx1LaoA

A talk hosted by the Rajpurkar Lab at Harvard which works on developing medical AI. Lab member Jon Williams on "Language Models are General-Purpose Interfaces" by Microsoft Research. 论文精读,对模型架构的介绍

31

Improving alignment of dialogue agents via targeted human judgements

https://arxiv.org/pdf/2209.14375

Sparrow

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

对话机器人之Sparrow

https://blog.csdn.net/qq_27590277/article/details/128451201

带着读者理解论文的引导性理解精读,最后总结了博主的个人观点

技术细节梳理, 引导理解, 作者presentation

Google

★★★★☆

Building safer dialogue agents

https://deepmind.google/discover/blog/building-safer-dialogue-agents/

谷歌官方介绍该模型的博客,用一些example帮助理解模型

略读文章, 见解分析, 引导理解

Other

★★★★☆

DeepMind Sparrow 对话系统简析

https://finisky.github.io/sparrow-summary/

比较简单的精读文章,对论文各个部分用自己的语言做了简要总结分析

相关拓展, 见解分析

知乎

★★★☆☆

DeepMind推出AI聊天机器人Sparrow,可通过谷歌搜索来回答问题

https://zhuanlan.zhihu.com/p/567878451

非精读文章,关于聊天机器人的一些看法

32

Scaling Instruction-Finetuned Language Models

https://arxiv.org/pdf/2210.11416


- Source Code

https://github.com/google-research/t5x/blob/main/docs/models.md#flan-t5-checkpoints

PaLM, Flan-T5

精读视频, 相关拓展, 见解分析, 引导理解, 技术点详解

Youtube

★★★★★

Scaling Instruction-Finetuned Language Models (Flan-PaLM)

https://www.youtube.com/watch?v=QdwETwqyREY

不仅详细精读了本文模型的细节,还和prior work做了一下comparison,由浅到深的精读讲解

精读视频, 见解分析, 引导理解, 技术点详解

Bilibili

★★★★★

FLAN-T5模型(谷歌发布的适用于多个任务的通用语言模型)

https://www.bilibili.com/video/BV1ox4y1N7xB/

简单易懂的讲解

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

【LLM系列之FLAN-T5/PaLM】Scaling Instruction-Finetuned Language Models

https://blog.csdn.net/yanqianglifei/article/details/130568753

顺着论文逻辑引导读者理解重点,比较全面细节

模型使用教程

CSDN

★★★★☆

【传知代码】Flan-T5 使用指南(论文复现)

https://blog.csdn.net/qq_53123067/article/details/140892605

展示如何加载和运行 Flan-T5 模型并提供不同任务的运行示例和结果展示,以及它在不同应用场景中的实际应用和优势

略读文章, 见解分析, 引导理解

CSDN

★★★★☆

Scaling Instruction-Finetuned Language Models

https://blog.csdn.net/kebijuelun/article/details/131938800

总结了论文重点

技术细节梳理, 翻译式解读

知乎

★★★☆☆

论文笔记:Scaling Instruction-Finetuned Language Models

https://zhuanlan.zhihu.com/p/716055619

偏翻译的精读

33

GLM-130B: An Open Bilingual Pre-trained Model

https://arxiv.org/pdf/2210.02414


- Source Code

https://github.com/THUDM/GLM-130B/

GLM-130B

精读视频, 引导理解, 技术点详解, 作者presentation

Bilibili

★★★★★

GLM-130B:开源的双语千亿预训练模型——可在4张3090或8张1080Ti上使用的千亿模型

https://www.bilibili.com/video/BV1sd4y167BE

作者本人对于模型的一个非常详细的解读介绍

相关拓展, 见解分析, 引导理解, 技术点详解

Bilibili

★★★★★

ChatGLM 130B大模型训练教训总结

https://www.bilibili.com/video/BV1RM411S7iD

介绍了ChatGLM训练中有哪些问题,怎么解决,以及如何加速训练

技术细节梳理, 引导理解, 模型使用教程

GitHub

★★★★★

GLM-130B:开放的中英双语预训练模型

https://github.com/THUDM/GLM-130B/blob/main/README_zh.md

官方博客,介绍了模型架构,训练和表现,以及快速上手的运行教程

技术细节梳理, 见解分析, 引导理解, 技术点详解

知乎

★★★★★

来自清华的ChatGPT?GLM-130B详解

https://zhuanlan.zhihu.com/p/617701482

比较全面的精读,在中间的细节实验部分有一点机翻,前后的介绍和总结有一些自己的见解

模型使用教程, 模型实战

CSDN

★★★★★

GLM-130B本地部署的实战方案

https://herosunly.blog.csdn.net/article/details/131523682

介绍了模型本地部署的实战方案

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

论文浅读:GLM-130B( AN OPEN BILINGUAL PRE-TRAINEDMODEL)

https://blog.csdn.net/weixin_44292902/article/details/131405061

总结性精读,文末提出博主认为比较重要的是“通过引入嵌入层梯度收缩(Embedding Layer Gradient Shrink )来提高模型的稳定性。”

见解分析, 引导理解, 代码解析, 相关拓展

CSDN

★★★★★

大模型-GLM-130B

https://blog.csdn.net/poorlytechnology/article/details/133617255

介绍总结了GLM和ChatGLM的技术细节

34

Holistic Evaluation of Language Models

https://arxiv.org/pdf/2211.09110


- Source Code

https://github.com/stanford-crfm/helm

HELM

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

HELM 全面语言模型评测【论文精读·50】

https://www.bilibili.com/video/BV1z24y1B7uX/

李沐老师的逐段精读

精读视频, 引导理解, 作者presentation

Youtube

★★★★★

Rishi Bommasani -- Holistic Evaluation of Language Models (February 15th 2023)

https://www.youtube.com/watch?v=A0kD00WdlKY

论文作者的guest lecture,很详细的精读了整篇论文

模型使用教程, 模型实战, 引导理解

Youtube

★★★★★

Step by Step Evaluation of AI Model Using HELM

https://www.youtube.com/watch?v=TkJgc2zGsCc

step-by-step使用HELM来评估模型的教程实战

翻译式解读

知乎

★★★★☆

【骆驼读论文】斯坦福大佬Percy Liang一作,44位研究者联名,对于大语言模型的整体评估,GLM130B的得分很不错

https://zhuanlan.zhihu.com/p/622458940

论文翻译

略读文章, 技术点详解, AI Generated

CSDN

★★★☆☆

论文分享丨Holistic Evaluation of Language Models

https://blog.csdn.net/devcloud/article/details/129706187

总结介绍了论文比较重要的一些结论

35

BLOOM: A 176B-Parameter Open-Access Multilingual

Language Model

https://arxiv.org/pdf/2211.05100


- HuggingFace Model Card

https://huggingface.co/bigscience/bloom

BLOOM

精读视频, 相关拓展, 见解分析, 引导理解

Bilibili

★★★★★

抱抱脸的1760亿Bloom模型又什么值得期待的?新的深度学习NLP生成backbone,新的position embedding,更多语言包括代码

https://www.bilibili.com/video/BV173411c7AB/

带着读者读论文,比较全面的精读视频

代码解析

知乎

★★★★★

【自然语言处理】【大模型】BLOOM模型结构源码解析(单机版)

https://zhuanlan.zhihu.com/p/625911234

基于transformers中BLOOM模型代码来解析BLOOM的原理及实现,对代码进行了解析注释

相关拓展, 技术点详解

HuggingFace

★★★★★

Optimization story: Bloom inference

https://huggingface.co/blog/bloom-inference-optimization

(翻译)优化故事: BLOOM 模型推理

https://zhuanlan.zhihu.com/p/622685227

This article gives you the behind-the-scenes of how we made an efficient inference server that powers bloom.

相关拓展, 技术点详解, AI Generated

CSDN

★★★★☆

BLOOM 模型的核心原理、局限与未来发展方向解析

https://blog.csdn.net/weixin_43114209/article/details/142697196

详细解析 BLOOM 系列模型的核心原理,帮助读者理解其架构设计、关键技术以及训练方法;AI生成的,有点机械

模型使用教程, AI Generated, 略读文章

CSDN

★★★★☆

全面解析开源大语言模型:BLOOM

https://blog.csdn.net/yugongpeng/article/details/135852626

简要介绍了BLOOM 模型的架构,以及如何使用 BLOOM,使用BLOOM 生成创意故事

翻译式解读

知乎

★★★☆☆

【自然语言处理】【大模型】BLOOM:一个176B参数且可开放获取的多语言模型

https://zhuanlan.zhihu.com/p/603518061

翻译解读

略读文章, 模型使用教程

Datacamp

★★★☆☆

Exploring BLOOM: A Comprehensive Guide to the Multilingual Large Language Model

https://www.datacamp.com/blog/exploring-bloom-guide-to-multilingual-llm

简单介绍了模型,用一个example介绍了如何使用该模型

36

Galactica: A Large Language Model for Science

https://arxiv.org/pdf/2211.09085


- Huggingface Model Card

https://huggingface.co/facebook/galactica-6.7b

- Model API for GALACTICA

https://github.com/paperswithcode/galai/tree/main

Galactica

技术细节梳理, 精读视频, 相关拓展, 见解分析, 引导理解

Youtube

★★★★★

Galactica: A Large Language Model for Science (Drama & Paper Review)

https://www.youtube.com/watch?v=ZTs_mXwMCs8

This video explains the paper, but also dives into the drama that ensued once Meta released a public demo of the model. 精读部分带着读者一步一步解析论文,非常全面的介绍

翻译式解读

知乎

★★★☆☆

Galactica:科学的大型语言模型

https://zhuanlan.zhihu.com/p/606566994

论文翻译

略读文章, 见解分析

知乎

★★★☆☆

大模型能自己「写」论文了,还带公式和参考文献,试用版已上线

https://zhuanlan.zhihu.com/p/584003463

总结介绍了模型概述和实验细节

知乎讨论, 见解分析

知乎

★★☆☆☆

AI 模型 Galactica 可自动生成文献综述和百科等,技术上如何实现的?

https://www.zhihu.com/question/567201775/answer/3060257485

讨论了一下大家对于论文方法的解析和看法

如何看待Meta AI团队的大型语言模型Galactica? 模型的发布对未来科研产生怎样影响?

https://www.zhihu.com/question/567268074/answer/2766253346

37

OPT-IML : Scaling Language Model Instruction Meta

Learning through the Lens of Generalization

https://arxiv.org/pdf/2212.12017


- HuggingFace Model Card

https://huggingface.co/facebook/opt-iml-30b

- Source Code

https://github.com/facebookresearch/metaseq/tree/main/projects/OPT-IML

OPT-IML

技术细节梳理, 翻译式解读

知乎

★★★★☆

OPT-IML:通过泛化的视角扩展语言模型指令元学习

https://zhuanlan.zhihu.com/p/595376597

论文翻译

精读视频, 见解分析, 引导理解, 技术点详解

Youtube

★★★★★

Meta AI OPT-IML Instruction Meta Learning LLM Research Paper Explained

https://www.youtube.com/watch?v=13drTbKb7so

逐段论文精读,评论区的链接有一个demo的notebook https://colab.research.google.com/drive/12fZbhsZerVxhCDgsJGhZi_CFHN7K6szY?usp=sharing

精读视频, 模型使用教程

Youtube

★★★★★

Meta AI OPT Open Pre-trained Transformer Language Models OPT-175B and OPT 1.3B Demo

https://www.youtube.com/watch?v=kwGKhvO-tpo

A short explanation and demo of OPT-175B and OPT 1.3B models

精读视频, 引导理解, 见解分析, 模型使用教程, 代码解析

Youtube

★★★★★

OPT-IML - InstructGPT's baby brother from Meta AI - Code Tutorial

https://www.youtube.com/watch?v=whireM07DUk

对于代码的精讲tutorial:https://colab.research.google.com/drive/16gFY2ZnRLbsU5U2LNtNMu8KWDvZpogAl?usp=sharing

相关拓展, 见解分析

Youtube

★★★★☆

Meta's OPT - GPT's Strongest Challenger in Open Source

https://www.youtube.com/watch?v=Ejg0OunCi9U

将OPT和GPT3做了一些介绍和对比

38

The Flan Collection: Designing Data and Methods

for Effective Instruction Tuning

https://arxiv.org/pdf/2301.13688


- Source Code

https://github.com/google-research/FLAN/tree/main/flan/v2

FLAN

技术细节梳理, 相关拓展, 见解分析, 引导理解, 技术点详解, 翻译式解读

知乎

★★★★★

谷歌大模型指令微调:The Flan Collection

https://zhuanlan.zhihu.com/p/633346577

开篇总结了论文重点,然后每个section都很全面的翻译精读

引导理解

Youtube

★★★★★

The Flan Collection: Open Source Instruction Tuning | Paper explained

https://www.youtube.com/watch?v=x8i7uTJX9EA

介绍了paper的introductoon,results和conclusion

39

LLaMA: Open and Efficient Foundation Language Models

https://research.facebook.com/file/1574548786327032/LLaMA--Open-and-Efficient-Foundation-Language-Models.pdf


- HuggingFace

https://huggingface.co/meta-llama

- Source Code

https://github.com/Meta-Llama/llama

LLaMA

精读视频, 见解分析, 引导理解, 技术点详解

Bilibili

★★★★★

81、LLaMA-1 论文导读

https://www.bilibili.com/video/BV1Pb42177gr/

详细介绍了LLaMA-1论文,涉及摘要、引言、方法、结果、相关工作及结论等内容,重点讲解了LLaMA-1模型的设计、训练方法和性能表现

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

速通LLaMA1:《LLaMA: Open and Efficient Foundation Language Models》全文解读

https://blog.csdn.net/qq_60735796/article/details/142282868

先总览了论文的创新点、突破点、技术实现、算法创新及架构升级,然后对论文每一个部分进行了详细拆分讲解,以观点+原文+小结的方式理解论文

技术细节梳理, 见解分析, 引导理解, 翻译式解读

CSDN

★★★★★

LLMs之LLaMA:《LLaMA: Open and Efficient Foundation Language Models》翻译与解读

https://blog.csdn.net/qq_41185868/article/details/129770092

对论文的逐段翻译和精读总结,很全面

技术细节梳理, 相关拓展, 见解分析, 引导理解, 技术点详解, 代码解析

CSDN

★★★★★

LLaMA的解读与其微调(含LLaMA 2):Alpaca-LoRA/Vicuna/BELLE/中文LLaMA/姜子牙

https://blog.csdn.net/v_JULY_v/article/details/129709105

LLaMA的代码级解读和各种微调LLaMA,对每个微调都有相关介绍和代码讲解

技术细节梳理, 引导理解, 技术点详解, 代码解析

知乎

★★★★★

论文精读:LLaMA: Open and Efficient Foundation Language Models

https://zhuanlan.zhihu.com/p/676031354

非常详细的精读文章,有对代码的解析和重点内容的总结,对模型架构的解析很清楚

见解分析, 技术细节梳理

知乎

★★★★★

Meta “单GPU” LLM模型 LLaMA: Open and Efficient Foundation Language Models - 单GPU就能干大模型到底发生了什么?

https://zhuanlan.zhihu.com/p/610231660

本文适合有一定算法基础或者AI工程基础的同学科普阅读,夹带一些非技术点,算是调研总结,个人观点分享

分析了一下Llama模型的“单GPU”,梳理论文重点

技术细节梳理, 引导理解, 技术点详解, 代码解析, 翻译式解读

知乎

★★★★☆

LLaMA:开放和高效的基础语言模型

https://zhuanlan.zhihu.com/p/609843048

比较偏翻译的精读

精读视频, 引导理解

Youtube

★★★★☆

LLaMA: Open and Efficient Foundation Language Models (Paper Explained)

https://www.youtube.com/watch?v=E5OnoYF2oAk

带着读者一段一段精读论文

见解分析, 相关拓展, 略读文章

CSDN

★★★☆☆

LLaMA: Open and Efficient Foundation Language Models论文原文代码学习

https://blog.csdn.net/qq_44117805/article/details/142644694

对论文的重点部分进行了总结(论文关键点,数据集,训练以及结果),总结了Llama和BERT,GPT的对比

40

Language Is Not All You Need: Aligning Perception

with Language Models

https://arxiv.org/pdf/2302.14045


- Source Code

https://github.com/microsoft/unilm

Kosmos-1

技术细节梳理, 见解分析, 知乎讨论

知乎

★★★★★

有没有大佬解读一下KOSMOS-1?

https://www.zhihu.com/question/587008959/answer/3071494893

这个讨论里的解读都是比较通俗易懂的,融合了不同的解读和观点

精读视频, 引导理解

Youtube

★★★★★

Microsoft Kosmos-1 1.6B Multimodal ( Text and Image ) Large Language Model Paper Explanation

https://www.youtube.com/watch?v=EeOzU7ehw14

逐段精读,对论文重点进行解读

技术细节梳理, 引导理解, 略读文章

CSDN

★★★★★

多模态大语言基座模型KOSMOS-1《Language Is Not All You Need: Aligning Perception with Language Models》论文简要介绍

https://blog.csdn.net/qq_37261357/article/details/137560766

简要总结了论文的一些关键点,以bullet lists总结了论文基本信息,模型架构和实验

翻译式解读

知乎

★★★☆☆

[论文]KOSMOS-1——Language is not all you Need: Aligning Perception with Language Models

https://zhuanlan.zhihu.com/p/610266736

论文翻译

略读文章, 见解分析

CSDN

★★★☆☆

Kosmos-1: 通用接口架构下的多模态大语言模型

https://blog.csdn.net/LoseInVain/article/details/136428429

不算精读,但是以通俗易懂的语言介绍了论文的背景和方法

41

Resurrecting Recurrent Neural Networks for

Long Sequences

https://arxiv.org/pdf/2303.06349


- Unofficail Pytorch Implementation

https://github.com/Gothos/LRU-pytorch

- Unofficial JAX implementation

https://github.com/NicolasZucchet/minimal-LRU

LRU

技术细节梳理, 见解分析, 技术点详解, 引导理解

Other

★★★★★

Google新作试图“复活”RNN:RNN能否再次辉煌?

https://kexue.fm/archives/9554

对论文的背景,提出的动机以及各种技术细节,公式推导都介绍得很详细,有自己理解的同时引导读者思考

见解分析, 知乎讨论, 技术点详解

知乎

★★★★★

RNN的隐藏层需要非线性吗?

https://zhuanlan.zhihu.com/p/615672175

不是论文精读文章,讨论了论文的技术核心,以及和其他文章的联系,通俗易懂,见解也比较深刻

精读视频, 作者presentation, 引导理解, 技术点详解, 相关拓展

Youtube

★★★☆☆

Dr. Razvan Pascanu (Google DeepMind) - Resurrecting Recurrent Neural Networks for Language Modelling

https://www.youtube.com/watch?v=SiYOiAVgtNE

论文作者的一个lecture,主要focus在State Space Models (SSMs) , a subclass of Recurrent Neural Networks (RNNs) that has recently gained some attention

42

PaLM-E: An Embodied Multimodal Language Model

https://palm-e.github.io/assets/palm-e.pdf


- Demo

https://palm-e.github.io/#demo

- Source Code

https://github.com/kyegomez/PALM-E

PaLM, PaLM-E

技术细节梳理, 见解分析, 引导理解, 技术点详解

知乎

★★★★★

PaLM-E: 具身多模态语言模型(Embodied Multimodal Language Model)

https://zhuanlan.zhihu.com/p/615879292

讲的非常清晰细致且全面的精读和引导理解

技术细节梳理, 见解分析, 引导理解, 技术点详解, 略读文章

知乎

★★★★★

具身多模态大模型——Google PaLM-E论文解读

https://zhuanlan.zhihu.com/p/662935514

介绍了论文的内容,方法,结果和局限性

精读视频, 引导理解, 技术点详解

Youtube

★★★★☆

Google PaLM-E 562B Multimodal ( Text Image Sensors ) Large Language Model Paper Explanation

https://www.youtube.com/watch?v=mc9DuhK6D54

带着读者阅读了模型,demo以及论文的重点部分

技术细节梳理, 见解分析

CSDN

★★★★☆

论文阅读_PaLM-E

https://blog.csdn.net/xieyan0811/article/details/130043205

开篇有博主的读后感,然后对于模型架构精读介绍

技术细节梳理, 翻译式解读

CSDN

★★☆☆☆

PaLM-E: An Embodied Multimodal Language Model——一种具身多模态语言模型

https://blog.csdn.net/Together_CZ/article/details/143914430

翻译式精读

43

GPT-4 Technical Report

https://arxiv.org/pdf/2303.08774

GPT4

精读视频, 引导理解, 技术点详解, 相关拓展

Bilibili

★★★★★

GPT-4论文精读【论文精读·53】

https://www.bilibili.com/video/BV1vM4y1U7b5/

论文逐段精读,非常细致易懂

技术细节梳理, 引导理解

CSDN

★★★★★

GPT-4报告解读

https://blog.csdn.net/qq_42693848/article/details/129778214

比较中规中矩的精读文章

见解分析

知乎

★★★★★

关于 GPT4 Tech Report 的一些观察

https://zhuanlan.zhihu.com/p/616171041

博主自己的理解解读,

精读视频, 引导理解, 技术点详解

Youtube

★★★★☆

GPT-4 Technical Report - Paper Review

https://www.youtube.com/watch?v=0oXlykTLWVM

总结精读论文

技术细节梳理, 见解分析, 引导理解

知乎

★★★★☆

GPT-4 Technical Report 坐马桶上就能看完的简报

https://zhuanlan.zhihu.com/p/614391252

很通俗的通读解释了文章中的重点

翻译式解读

CSDN

★★★★☆

MLMs之GPT-4:《GPT-4 Technical Report》的翻译与解读

https://blog.csdn.net/qq_41185868/article/details/129572687

翻译式精读

相关拓展

CSDN

★★★☆☆

GPT-1, GPT-2, GPT-3, GPT-3.5, GPT-4论文内容解读

https://blog.csdn.net/BGoodHabit/article/details/130134446

GPT-1, GPT-2, GPT-3, InstructGPT / ChatGPT and GPT-4 总结

https://blog.csdn.net/u014365862/article/details/136782306

介绍对比GPT家族的模型

44

Visual Instruction Tuning

https://arxiv.org/pdf/2304.08485


- Source Code

https://github.com/haotian-liu/LLaVA

LLaVA

精读视频, 引导理解, 技术点详解

Bilibili

★★★★★

[论文速览]LLaVA: Visual Instruction Tuning[2304.08485]

https://www.bilibili.com/video/BV1n14y1k7B9/

快速精读论文的重点内容和原理,清晰易懂

精读视频, 引导理解, 技术点详解

Youtube

★★★★★

LLaVA - the first instruction following multi-modal model (paper explained)

https://www.youtube.com/watch?v=GMOREHJTbR4

很细致的精读,顺着论文带着读者理解重点

见解分析

知乎

★★★★★

Visual Instruction Tuning: 用LLaVA近似多模态GPT-4

https://zhuanlan.zhihu.com/p/622907299

分享了LlaVA模型的三个功能和博主使用模型的主要体验

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★★

【多模态大模型paper阅读笔记-5】LLaVA:Visual Instruction Tuning,5千字精读,最适合入门多模态大模型的工作

https://blog.csdn.net/Mugi_jiang/article/details/140664540

比较细致的精读

技术细节梳理, 引导理解

CSDN

★★★★☆

LLaVA论文(Visual Instruction Tuning)阅读笔记

https://blog.csdn.net/qq_58400270/article/details/135073408

LLaVA: Visual Instruction Tuning

https://blog.csdn.net/weixin_44966641/article/details/136331742

精读笔记,梳理文章内容,不是很细节

略读文章, 技术细节梳理

知乎

★★★★☆

【论文解读】LLaVA:视觉指令微调(Visual Instruction Tuning)

https://zhuanlan.zhihu.com/p/10479069500

总结性的精读梳理

模型实战

知乎

★★★★★

《LLM-Adapter》:如何对LLM进行Visual Instruction Tuning得到自己的VLM,并进行Visual SFT

https://zhuanlan.zhihu.com/p/702252219

模仿LLaVa对 Qwen2-0.5B-Instruct 进行Visual Instruction Tuning扩展其多模态能力,为其训练一个MLP Adapter,然后对其进行Visual SFT

45

Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling

https://arxiv.org/pdf/2304.01373


- Source Code

https://github.com/EleutherAI/pythia

Pythia

略读文章, 技术细节梳理

知乎

★★★★★

Pythia:从时间和尺度两方面解释LLM的利器

https://zhuanlan.zhihu.com/p/630803625

总结了模型简介和论文中的提到的模型案例研究

精读视频, 引导理解, 技术点详解

Youtube

★★★★★

Eleuther AI Pythia

https://www.youtube.com/watch?v=tC_YghFhJFM

非常细致的精读视频;这个印度老哥精读了很多LLM论文,虽然不是论文逐段精读,但是讲解都很清晰

46

Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision

https://arxiv.org/pdf/2305.03047


- Source Code

https://github.com/IBM/Dromedary

- HuggingFace Model Card

https://huggingface.co/zhiqings/dromedary-65b-lora-delta-v0

Dromedary

技术细节梳理, 略读文章, 模型使用教程

知乎

★★★★★

IBM也下场LLM了,自对齐、高效率的单峰驼Dromedary来了

https://zhuanlan.zhihu.com/p/627643379

问题简介,梳理了Dromedary模型(应用SELF-ALIGN到LLaMA-65b基本语言模型)的四个技术细节步骤

略读文章, 见解分析

知乎

★★★★☆

Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision

https://zhuanlan.zhihu.com/p/628431087

文章比较简短,开篇论文简介,介绍论文对于LLM提出的解决方案,然后简要总结;

47

PaLM 2 Technical Report

https://ai.google/static/documents/palm2techreport.pdf

PaLM

技术细节梳理, 略读文章, 见解分析

CSDN

★★★★★

PaLM 2重磅来袭,深挖谷歌92页技术报告亮点总结

https://blog.csdn.net/hanseywho/article/details/130884610

本文选取了论文中介绍PaLM的几个重点方面进行介绍,并结合谷歌IO大会上的一些产品亮点进行简要的总结

见解分析, 知乎讨论

知乎

★★★★★

最强语言模型 PaLM2 亮相,Bard 能力跃升,它可以实现哪些功能?算是 ChatGPT 杀手吗?

https://www.zhihu.com/question/600313536/answer/3023392563

这个讨论下的回答总结了一些论文里比较有意思的部分,加入了自己的经验,思考和分析

精读视频, 技术细节梳理, AI Generated

知乎

★★★★☆

如何快速理解 PaLM 2 技术报告?高中生也能轻松掌握!

https://www.zhihu.com/zvideo/1835042266957348864

一个AI-generated的精读视频,逻辑还是比较清晰的,人机感比较重

48

RWKV: Reinventing RNNs for the Transformer Era

https://arxiv.org/pdf/2305.13048


- Source Code

https://github.com/BlinkDL/RWKV-LM

RWKV

精读视频, 引导理解, 作者presentation

Bilibili

★★★★★

RWKV:在Transformer时代重塑RNN

https://www.bilibili.com/video/BV1b8411Z7Df/

作者解读论文,非常细致全面

技术细节梳理, 引导理解, 相关拓展, 技术点详解, 代码解析

知乎

★★★★★

【手撕LLM-RWKV】重塑RNN 效率完爆Transformer

https://zhuanlan.zhihu.com/p/655991768

介绍了RWKV和Transformer的对比,细致解读了模型,算法和代码

技术细节梳理, 引导理解

知乎

★★★★★

AI论文推荐-RWKV: Reinventing RNNs for the Transformer Era

https://zhuanlan.zhihu.com/p/646366058

分段总结精读论文

RWKV: Reinventing RNNs for the Transformer Era

https://zhuanlan.zhihu.com/p/634466839

见解分析, 引导理解, 技术点详解

CSDN

★★★☆☆

RWKV论文燃爆!将RNN崛起进行到底!可扩百亿级参数,与Transformer表现相当!

https://blog.csdn.net/qq_27590277/article/details/130858400

讲解了RWKV背后的注意力、时间混合和通道混合模块的原理与组成

技术细节梳理, 引导理解

知乎

★★★★★

RWKV 模型解析

https://zhuanlan.zhihu.com/p/640050680

讲解了RWKV的结构最核心的两部分Channel-Mixing 与 Time-Mixing

49

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

https://arxiv.org/pdf/2305.18290


- Source Code

https://github.com/eric-mitchell/direct-preference-optimization

DPO

精读视频, 见解分析, 引导理解

Youtube

★★★★★

Direct Preference Optimization (DPO): Your Language Model is Secretly a Reward Model Explained

https://www.youtube.com/watch?v=HCFTXTn1PHA

带着读者读论文的精读视频,分屏操作边读边板书讲解

技术细节梳理, AI Generated, 见解分析

CSDN

★★★★★

【论文阅读】理解DPO,《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》

https://blog.csdn.net/bylander/article/details/141904536


【论文速读】《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》

https://blog.csdn.net/bylander/article/details/141873157

个人理解总结,回顾了RLHF方法,介绍了DPO主要流程。比较有意思的是博主通过腾讯元宝生成了论文学术海报。

技术细节梳理, 见解分析, 引导理解, 略读文章

CSDN

★★★★★

【基础知识】DPO(Direct Preference Optimization)的原理以及公式是怎样的?

https://blog.csdn.net/u014386899/article/details/136633074

总结文章重点及关键公式推导的详细步骤

技术细节梳理, 见解分析, 引导理解

知乎

★★★★★

Direct Preference Optimization(DPO)学习笔记

https://zhuanlan.zhihu.com/p/676371444

写得很清晰的笔记,很适合做论文overview

相关拓展, 引导理解

Youtube

★★★★★

RLHF & DPO Explained (In Simple Terms!)

https://www.youtube.com/watch?v=nSrj1J6ODoM

This video doesn't go deep on math. Instead, I provide a high-level overview of each technique to help you make practical decisions about where to focus your time and energy.

相关拓展, 技术点详解

Bilibili

★★★★☆

DPO (Direct Preference Optimization) 算法讲解

https://www.bilibili.com/video/BV1GF4m1L7Nt

算法详解视频,很清晰

技术细节梳理

知乎

★★★★☆

DPO: Direct Preference Optimization 论文解读及代码实践

https://zhuanlan.zhihu.com/p/642569664

本文重点介绍DPO的使用场景和最简代码

翻译式解读

CSDN

★★★☆☆

Direct Preference Optimization: Your Language Model is Secretly a Reward Model翻译

https://blog.csdn.net/qq_28385535/article/details/135098168

论文翻译

技术点详解

CSDN

★★★☆☆

Direct Preference Optimization数学知识详解

https://blog.csdn.net/m0_67146053/article/details/135575133

对于论文中的部分数学知识进行详细解释

50

Tree of Thoughts: Deliberate Problem Solving

with Large Language Models

https://arxiv.org/pdf/2305.10601


- Source Code

https://github.com/princeton-nlp/tree-of-thought-llm

ToT

精读视频, 引导理解, 见解分析

Youtube

★★★★★

Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Full Paper Review)

https://www.youtube.com/watch?v=ut5kp56wW_4

精读paper的视频,讲解非常清晰,博主自己也有一些观点和想法

技术细节梳理, 见解分析, 引导理解, 技术点详解

Medium

★★★★★

Paper Explained: Tree of Thoughts — Deliberate Problem Solving with Large Language Models

https://kargarisaac.medium.com/paper-explained-tree-of-thoughts-deliberate-problem-solving-with-large-language-models-46958bef0319

very insightful and informative paper summary

技术细节梳理, 见解分析, 引导理解

CSDN

★★★☆☆

TOT(Tree of Thought) | 让GPT-4像人类一样思考

https://blog.csdn.net/qq_27590277/article/details/131448071

精读文章,有一些阅读笔记,related work做成了思维导图

翻译式解读

CSDN

★★☆☆☆

论文翻译 | Tree of Thoughts: Deliberate Problem Solvingwith Large Language Models 思维树ToT

https://blog.csdn.net/m0_49651195/article/details/141643311

论文翻译

51

Llama 2: Open Foundation and Fine-Tuned Chat Models

https://arxiv.org/pdf/2307.09288


- Source Code

https://github.com/meta-llama/llama

LLaMA2

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

Llama 2 模型结构解析

https://www.bilibili.com/video/BV12h4y1N7C8

attention讲得很透彻,少有的清楚地描述QKV矩阵的形状及变换的教程视频

精读视频, 见解分析, 引导理解, 模型使用教程, 代码解析

Bilibili

★★★★★

[LLMs 实践] 14 llama2 introduction 及 fine tune llama2(guanaco dataset)

https://www.bilibili.com/video/BV1xP411x7TL

非常全面详细的LLama2精读系列视频,后面几节也有源码讲解

技术细节梳理, 见解分析, 引导理解

Youtube

★★★★★

Llama 2: Full Breakdown

https://www.youtube.com/watch?v=zJBpRn2zTco

This video covers the most noteworthy bits, including:

The benchmark results

The decision to release in the face of the US Senate

Why Zuckerberg opensourced Llama 2, including the Mistral AI Factor

The opensource signatory list

How Orca and Phi-1 compare

Why Llama 2 might soon be everywhere

技术细节梳理, 见解分析, 引导理解, 技术点详解

知乎

★★★★★

一文读懂Llama 2(从原理到实战)

https://zhuanlan.zhihu.com/p/653303123

比较通俗地介绍了LlaMa 2的技术原理以及如何Fine-tuning

技术细节梳理, 见解分析, 引导理解

CSDN

★★★★☆

速通LLaMA2:《Llama 2: Open Foundation and Fine-Tuned Chat Models》全文解读

https://blog.csdn.net/qq_60735796/article/details/142315279

非常全面的论文精读,结尾也有一些博主的thoughts

Llama 2: Open Foundation and Fine-Tuned Chat Models

https://blog.csdn.net/kebijuelun/article/details/131830821

技术细节梳理, 模型使用教程, 模型实战, 引导理解

CSDN

★★★★☆

LLMs之LLaMA-2:LLaMA-2的简介(技术细节)、安装、使用方法(开源-免费用于研究和商业用途)之详细攻略

https://blog.csdn.net/qq_41185868/article/details/131819938

LLaMA-2的简介(技术细节)、安装、使用方法(开源-免费用于研究和商业用途)之详细攻略

模型实战

CSDN

★★★★☆

打造个人聊天助手:本地部署Llama 2并通过Chatbot-Ollama实现Web交互

https://blog.csdn.net/2301_78611726/article/details/143778037

本文分享如何在群晖NAS上本地部署并运行一个基于大语言模型Llama 2的个人聊天机器人,并结合内网穿透工具实现公网远程访问

52

Mistral 7B

https://arxiv.org/pdf/2310.06825


- Source Code

https://github.com/mistralai/mistral-inference

Mistral 7B

精读视频, 见解分析, 引导理解

Youtube

★★★★★

Mistral 7b - the best 7B model to date (paper explained)

https://www.youtube.com/watch?v=ffWLSac_ve8

In this video let's have a look at all three contributions of the Mistral 7 billion model in detail followed by the result comparing LLAMA 2 and code LLAMA with Mistral 7b from Mistral AI.

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

本地 Mistral 7B 模型 推理(1/2)

https://www.bilibili.com/video/BV1Ze411n7wn/

本地 Mistral 7B 模型推理(2/2)

https://www.bilibili.com/video/BV17W4y1c7yp

讲解非常清晰详细的精读视频

模型使用教程

Bilibili

★★★★☆

击败Llama3,简单几步微调Mistral 7b v0.3大模型!本地运行+Colab微调Mistral开源大模型!没有显卡也能微调大模型!#mistral

https://www.bilibili.com/video/BV1mm421M7og

本期视频主要演示了如何使用ollama在本地运行mistral 7b v0.3大模型,并且使用unsloth在colab上用中文数据集微调mistral 7b,然后将量化后的GGUF模型保存到huggingface

见解分析, 引导理解, 技术点详解

CSDN

★★★★☆

[论文笔记]Mistral 7B

https://blog.csdn.net/yjw123456/article/details/139427299

精读了论文中的方法以及模型架构,分析模型表现,不算特别详尽

详解各种LLM系列|(3)Mistral-7B 技术内容详解

https://blog.csdn.net/weixin_49659123/article/details/135243440

略读文章, 模型使用教程

CSDN

★★★☆☆

开源模型Mistral 7B+Amazon SageMaker部署指南

https://blog.csdn.net/air__Heaven/article/details/136427209

模型简介+通过Amazon SageMaker JumpStart一键部署Mistral 7B 基础模型的教程

模型实战

Kaggle

★★★☆☆

Retrieval Augmented Generation with Mistral 7b

https://www.kaggle.com/code/lusfernandotorres/retrieval-augmented-generation-with-mistral-7b/notebook

翻译:为 Mistral 7b 模型构建检索增强生成 (RAG) 系统

https://blog.csdn.net/weixin_37863729/article/details/140854011

使用Wikipedia Crypto Articles(Kaggle 上的数据集)为 LLM 实现RAG系统

53

Mamba: Linear-Time Sequence Modeling with Selective State Spaces

https://arxiv.org/pdf/2312.00752


- Source Code

https://github.com/state-spaces/mamba

Mamba

技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展

CSDN

★★★★★

一文通透想颠覆Transformer的Mamba:从SSM、HiPPO、S4到Mamba(被誉为Mamba最佳解读)

https://blog.csdn.net/v_JULY_v/article/details/134923301

点赞率很高的一篇非常通透全面的讲解,确实是“最佳解读”

技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展

CSDN

★★★★★

Mamba 基础讲解【SSM,LSSL,S4,S5,Mamba】

https://blog.csdn.net/zyw2002/article/details/136840829

涵盖了模型的提出背景和特性介绍,以及一些补充知识

精读视频, 见解分析, 引导理解

Youtube

★★★★★

Mamba: Linear-Time Sequence Modeling with Selective State Spaces (Paper Explained)

https://www.youtube.com/watch?v=9dSkvxS2EB0

清晰易懂的paper review

Bilibili

★★★★★

【汇报】 Mamba模型及其公式推导

https://www.bilibili.com/video/BV17A4m1F7RX

模型使用教程

CSDN

★★★☆☆

Mamba 环境安装踩坑问题汇总及解决方法(Windows已解决)

https://blog.csdn.net/yyywxk/article/details/136071016

非常详细的记录了Mamba环境安装的问题及解决方案,并且至今一直在更新

54

DeepSeek-V2: A Strong, Economical, and Efficient

Mixture-of-Experts Language Model

https://arxiv.org/pdf/2405.04434


- Source Code

https://github.com/deepseek-ai/DeepSeek-V2

DeepSeek-v2

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

通过看DeepSeek-v2思考目前大模型学习路径

https://www.bilibili.com/video/BV1cm421M7DA

不仅带着读者一起阅读和理解paper,还提出了自己的一个学习路径,引导入门者了解人工智能和机器学习的逻辑与常识, 帮助构建自己的大型语言模型

技术细节梳理, 引导理解, 相关拓展

CSDN

★★★★★

一文通透DeepSeek-V2和其V3版本(改造Transformer的中文模型):详解MoE、GRPO、MLA

https://blog.csdn.net/v_JULY_v/article/details/141535986

从DeepSeek LLM、DeepSeekMoE到DeepSeekMath,再到DeepSeek-V2的细节,非常全面的拓展和介绍

知乎讨论, 见解分析, 相关拓展, 技术点详解

知乎

★★★★★

如何看待 DeepSeek 发布的 MoE 大模型 DeepSeek-V2?

https://www.zhihu.com/question/655172528/answer/3489934651

热度很高的讨论,有很多观点分享和细节分析

技术细节梳理, 引导理解, 翻译式解读

CSDN

★★★★☆

最新的混合专家大语言模型DeepSeek-V2

https://blog.csdn.net/yorkhunter/article/details/139415435

比较详细的论文精读

模型使用教程

CSDN

★★☆☆☆

deepseek-v2-pytorch对话问答算法模型

https://blog.csdn.net/qq_27815483/article/details/139736182

比较简短的模型运行教程

55

Transformers are SSMs: Generalized Models and Efficient Algorithms

Through Structured State Space Duality

https://arxiv.org/pdf/2405.21060


- Source Code

https://github.com/state-spaces/mamba

Mamba, Mamba2

技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展

CSDN

★★★★★

一文通透mamba2「力证Transformer are SSM」:从SSM、半可分矩阵、SMA、SSD到mamba2

https://blog.csdn.net/v_JULY_v/article/details/140131413

和Mamba1的最佳解读是同一个作者,一样高质量的通透全面解读

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

AI大讲堂:敢叫transformer换新天!专业拆解【Mamba-2模型】

https://www.bilibili.com/video/BV16f421B7dB/

万字长文人话讲解5个问题: 1. 如何用两性话题统一SSM和注意力机制? 2. SSM矩阵的巧妙设计 3. 注意力机制的通用实现 4. 状态空间对偶是什么 5. Mamba-2模型如何对Transformer形成了碾压

技术点详解, 代码解析, 引导理解

CSDN

★★★★★

(简单易学)mamba2核心ssd算法逻辑整理(基于mamba2-minimal实现)

https://blog.csdn.net/qq_37643054/article/details/140820602

逐步拆解Mamba-2 模型的核心算法 Structured State Space Duality (SSD),代码,理解其背后的原理和运作机制

技术细节梳理, 见解分析, 引导理解, 技术点详解, 相关拓展

CSDN

★★★★★

Mamba v2诞生:1 儒(Transformers)释(SSD)道(Mamba)本是一家?!

https://blog.csdn.net/Janexjy/article/details/139482926

Mamba v2诞生:2 那些烧脑的矩阵们

https://blog.csdn.net/Janexjy/article/details/139535672

Mamba v2诞生:3 SMA与Mamba-2

https://blog.csdn.net/Janexjy/article/details/139565005

对于Mamba V2详细解读的一套文章

模型使用教程

CSDN

★★★★☆

Mamba2-minimal(mamba2最简实现)的使用与若干问题解决办法

https://blog.csdn.net/weixin_48432756/article/details/140407066

由于官方实现较于复杂,不利于理解原理以及后期对模型进行改进,本文对mamba2-minimal模型进行了本地运行实验并总结了调试过程中的若干问题解决方法

56

The Llama 3 Herd of Models

https://arxiv.org/pdf/2407.21783


- Source Code

https://github.com/meta-llama/llama3

LLaMA3

精读视频, 见解分析, 引导理解

Bilibili

★★★★★

Llama 3.1论文精读 · 1. 导言【论文精读·54】

https://www.bilibili.com/video/BV1WM4m1y7Uh

李沐老师论文精讲

Youtube

★★★★★

Llama 405b: Full 92 page Analysis, and Uncontaminated SIMPLE Benchmark Results

https://www.youtube.com/watch?v=Tf1nooXtUHE

Went through the highlights of all 92 pages

评论区也有一些非常有用的links

模型使用教程, 模型实战

Bilibili

★★★★★

B站公认最强的LLAMA3保姆级教程,llama3微调-量化-部署-应用实例解读,还学不会的你来锤爆我!人工智能|机器学习|深度学习

https://www.bilibili.com/video/BV1DbpFeYEPr

llama微调-量化-部署-应用一条龙解读

技术细节梳理, 引导理解, 见解分析, 技术点详解

CSDN

★★★★★

速通LLaMA3:《The Llama 3 Herd of Models》全文解读

https://blog.csdn.net/qq_60735796/article/details/142416119

论文比较长,这篇博客是非常详细的精读梳理文章,原文节选解析,详尽分析了数学原理

知乎

★★★★☆

【LLM技术报告】《The Llama 3 Herd of Models》——Llama 3.1技术报告(精华版)

https://zhuanlan.zhihu.com/p/712251536

挑选精华章节的翻译和精读

知乎讨论, 见解分析, 相关拓展, 技术点详解

知乎

★★★☆☆

如何看待MetaAI开源Llama3大模型?

https://www.zhihu.com/question/653375287/answer/3495071576

关于Llama3的讨论和解析

57

Qwen2.5 Technical Report

https://arxiv.org/pdf/2412.15115


- Source Code

https://github.com/QwenLM/Qwen2.5

Qwen2.5

精读视频, 见解分析, 引导理解, 作者presentation

Bilibili

★★★★★

Qwen2.5-Coder开源报告解读,prompt编程来了!

https://www.bilibili.com/video/BV1TFUdYwEzu/

作者本人的论文解读,非常详细易懂

技术细节梳理, 见解分析, 引导理解, 技术点详解

GitHub

★★★★★

Qwen2.5-Coder 技术报告详细解读(非机翻)

https://github.com/Mxoder/LLM-from-scratch/blob/main/3.%20Qwen2.5%20Technical%20Report%20Analysis/Qwen2.5-Coder%20%E6%8A%80%E6%9C%AF%E6%8A%A5%E5%91%8A%E8%A7%A3%E8%AF%BB.md

对coder和math部分的全面解读,带有博主自己的理解,很通俗易懂

知乎讨论, 见解分析, 相关拓展, 技术点详解

知乎

★★★★★

如何解读Qwen2.5 Technical Report?有哪些新的技术点耳目一新?

https://www.zhihu.com/question/7364394830/answer/59941132327

有很多细致回答的讨论,很多总结了论文的技术细节来对比Qwen2.5的进步和performance

见解分析, 引导理解, 模型实战

Bilibili

★★★★☆

最强开源编程大模型Qwen2.5-coder-32B-instruct!部署安装Bolt.new和Cline+Qwen2.5-coder多维度测试

https://www.bilibili.com/video/BV1JtUTYmEbM/

部署安装Bolt.new和Cline+Qwen2.5-coder进行模型多维度测试,非常中肯的评价了模型效果

模型实战

Bilibili

★★★☆☆

【喂饭教程】20分钟学会微调大模型Qwen2.5,环境配置+模型微调+模型部署+效果展示详细教程!草履虫都能学会~

https://www.bilibili.com/video/BV1uHzGYREi6

使用llama-factory微调QWen2.5,讲了llama-factory的参数设置,但是没有讲如何准备数据,和训练结果的使用,还要同步github的数据格式示例和推理

技术细节梳理, 见解分析, 引导理解, 略读文章

CSDN

★★★☆☆

【论文解读】Qwen2.5 技术报告,非常详细收藏我这一篇就够了

https://blog.csdn.net/2401_85390073/article/details/144727500

对论文的总结是比较简略的,通过QnA问答的方式帮助读者理解



DIY吧 除非你...
若你有信心 我建议CS申硕申博求职DIY~ 若你想找专家伴你成长 我建议寻找做啥成啥的人 他们能力强 资源多 能解决你一切CS申硕申博求职身份生活的挑战~
先找其他机构?
肯定有其他靠谱机构 但如果你感觉他们干不过我、或你走投无路了 你再来找我吧hhh 但如果我没名额了 希望你别难过 我不是针对你 而是我每年名额都会满
就想加肖哥微信
我的微信被我藏在我荡气回肠的人生经历里 xiaogeedu.tech/col.jsp?id=253 辛苦你去找下hhh 我是美西时区 但每年9月中-12月中是申请季/招聘季 作息是乱的
不考虑商业合作
不商业合作 因为我不知谁靠谱 不合作能杜绝狗血 因噎废食能保护我自己 且我不缺流量还要赶走流量 找我合作您巨亏hh 我与任何商家或申硕申博求职中介都无关
用电脑访问本站
不建议用手机端访问本站,看着贼挤,在电脑端看着舒服hh