(十)LLM大语言模型学习路径
1. 初阶
顺序 | 资源 | 知识分类/使用方法 | 链接和介绍 |
1 | 申请OpenAI:Developer quickstart | 【实战】 | https://platform.openai.com/docs/quickstart?context=python API reference:https://platform.openai.com/docs/api-reference |
2 | Andrej Karpathy大神亲授:大语言模型入门【中英】 | 【大局观】 1小时的科普 | 中文文章:https://www.163.com/dy/article/IK8JG8FH05534HHB.html |
3 | ChatGPT Prompt Engineering for Developers 面向开发者的 ChatGPT 提示词工程 | 【Prompt Engineering】【实战】 提示工程(Prompt Engineering)关注提示词开发和优化,帮助用户将大语言模型用于各场景和研究领域。 掌握了提示工程相关技能将有助于用户更好地了解大型语言模型的能力和局限性。 | https://www.bilibili.com/video/BV1s24y1F7eq/ 英文: https://zhuanlan.zhihu.com/p/625917566 https://www.deeplearning.ai/short-courses/chatgpt-prompt-engineering-for-developers/ 课程笔记:https://github.com/datawhalechina/prompt-engineering-for-developers 课程主页(中文):https://github.com/GitHubDaily/ChatGPT-Prompt-Engineering-for-Developers-in-Chinese |
3 | Prompt Engineering资源 | 【Prompt Engineering】【实战】 | Prompt-engineering https://github.com/brexhq/prompt-engineering (中文)保姆级指南:大模型prompt的最佳实践 https://m.huxiu.com/article/2058854.html (中文)Prompt Engineering Guide 提示工程指南 https://www.promptingguide.ai/zh 各个模型的介绍: |
4 | Stanford CS324 Large Language Models | 【大局观】 没有视频,是文章形式的,适合喜欢看文字的朋友 | https://stanford-cs324.github.io/winter2022/ Percy Liang刚开的新课,主要材料是一些notes,介绍了大语言模型的基础知识、能力范围、训练部署以及一些大模型相关的问题(数据安全、法律、危害等),总体来说比较简单,适合入门。 |
4 | 【大模型技术与交叉应用】清华刘知远 | 【大局观】 中文课程 | https://www.bilibili.com/video/BV1UG411p7zv/?vd_source=72867308e8b7b6d7774a7e4be6278f68 从NLP到大模型的综合课程,挑选感兴趣的了解。偏实践。 |
5 | LLMSurvey A Survey of Large Language Models | 【大局观】 这是一篇综述 | https://github.com/RUCAIBox/LLMSurvey?tab=readme-ov-file#chinese-version 作为入门资料偏难,看不懂的部分可以等到后面章节再回头重看。全面介绍了当前大型语言模型,包括发展时间线、模型规模、训练策略、训练数据、硬件等等。 |
6 | Stanford cs224n Natural Language Processing with Deep Learning | 【NLP】 | https://www.bilibili.com/video/BV18Y411p79k/ 笔记: https://www.showmeai.tech/tutorials/36 课程主页:https://web.stanford.edu/class/cs224n/index.html Stanford 的 NLP 入门课程,由自然语言处理领域的巨佬 Chris Manning 领衔教授(word2vec 算法的开创者)。内容覆盖了词向量、RNN、LSTM、Seq2Seq 模型、机器翻译、注意力机制、Transformer 等等 NLP 领域的核心知识点。 5 个编程作业难度循序渐进,分别是词向量、word2vec 算法、Dependency parsing、机器翻译以及 Transformer 的 fine-tune。 最终的大作业是在 Stanford 著名的 SQuAD 数据集上训练 QA 模型,有学生的大作业甚至直接发表了顶会论文。 == 这门课程录制于深度学习爆发前夕,授课是斯坦福教授 Dan Jurafsky 和 Christopher Manning 教授,两位都是自然语言处理领域的神牛:前者写了《Speech and Language Processing》(中文译名:自然语言处理综论),目前第三版SLP3还在更新中;后者写了《Foundations of Statistical Natural Language Processing》(中文译名:统计自然语言处理)和《Introduction to Information Retrieval》(中文译名:信息检索导论),这几本书几乎是NLPer的必读书。这门课程适合NLP入门学习,可以了解基本的自然语言处理任务和早期经典的处理方法,以及和信息检索相关的一些方法。我把这门课程整理了一下按章节放在了B站,感兴趣的同学可以关注。 == 强烈推荐,主讲人是绝对的大牛 Christopher Manning,此课程从深度学习的角度出发对 NLP 进行全面的介绍,而其中的 talk 又涉及学术最前沿的进展,可谓广度与深度俱全 == 如果你最近刚开始接触NLP,你可能已经接触过这门流行的NLP课程。所有的讲座和幻灯片都是公开的,你可以在课程网站上找到它。这门课程非常注重NLP的深度学习方法,所以你会看到第一讲直接从词向量开始,然后过渡到卷积网络和transfomer等更高级的主题。如果你对经典的NLP方法感兴趣,你可能要看看开头提到的一本书。事实上,我强烈建议你这样做,因为它是对构建实际NLP系统在实践中有用的宝贵知识。 == 这是面向项目的最新课程,包括这个领域的最新进展。要上这门课,你需要有数学和编程的基础(Python或强大的C++能力)。我只会推荐有一定经验的人去上这门课,你会从中学到更深入的知识。 |
7 | State of GPT | 【GPT】 | https://www.youtube.com/watch?v=bZQun8Y4L2A PPT: https://karpathy.ai/stateofgpt.pdf GPT 联合创始人做的演示,极好的总结了 GPT 的训练和应用。 |
8 | LangChain for LLM Application Development | 【LangChain】 | https://learn.deeplearning.ai/langchain/lesson/1/introduction |
9 | Building Systems with the ChatGPT API | 【ChatGPT 】 | Deeplearning课程主页(这个主页上可以看视频的同时显示jupyter notebook,非常方便): https://learn.deeplearning.ai/chatgpt-building-system/lesson/1/introduction 中文字幕版:https://www.bilibili.com/video/BV1gj411X72B/ https://www.deeplearning.ai/short-courses/building-systems-with-chatgpt/ 这是DeepLearning.AI和OpenAI推出的另一门短期课程,让你更深入地了解ChatGPT API以及如何使用它们通过对LLMs进行链式调用来自动化复杂的工作流程。讲师是Isa Fulford和Andrew Ng,该课程限时免费。 这门课程适合初学者,你需要基本的Python理解才能完成课程。课程还可以适应中级或高级的机器学习工程师,希望学习关于LLMs的前沿提示工程技能。 你将学习如何构建与先前提示相关的提示链、与完成和新提示交互的系统,以及根据课程所学创建客服聊天机器人等内容。 通过学习以上所有免费课程,你将深入了解ChatGPT的技术知识,了解如何在不同的应用场景中使用它,定制提示以满足你的需求,并利用ChatGPT API创建聊天机器人等。 |
顺序 | 资源 | 知识分类/使用方法 | 链接和介绍 |
1 | 读论文 InstructGPT 论文(RLHF: Reinforcement Learning from Human Feedback) | 【模型】 | https://32931414.s21i.faiusr.com/61/ABUIABA9GAAg3rWCuwYo56jJtQY.pdf 中文: https://huggingface.co/blog/zh/rlhf https://huyenchip.com/2023/05/02/rlhf.html John Schulman - Reinforcement Learning from Human Feedback: Progress and Challenges: |
2 | openai-cookbook | 【实战】 | |
3 | Jay Alammar博客 | 【模型】 | 【The Illustrated Transformer】 https://jalammar.github.io/illustrated-transformer/ 由Jay Alammar提供的对Transformer架构更为技术性的概述。 非常经典的Transformer笔记,图文并茂的讲解Transformer的结构。如果你还不熟悉Transformer,那务必尝试一下这个资料! 【The Illustrated GPT-2 (Visualizing Transformer Language Models)图解 GPT2】 https://jalammar.github.io/illustrated-gpt2/ 中文翻译:https://zhuanlan.zhihu.com/p/139840113 【The Illustrated Stable Diffusion】 https://jalammar.github.io/illustrated-stable-diffusion/ 对潜在扩散模型(Stable Diffusion)的介绍,这是最常见的用于图像生成的生成式人工智能模型类型。 |
4 | 李宏毅大佬的深度学习与机器学习 | 【深度学习】 | https://www.bilibili.com/video/BV1J94y1f7u5/?vd_source=72867308e8b7b6d7774a7e4be6278f68 台湾大学李宏毅,国语教程里最好的,讲的很清楚,也比较有趣。 |
5 | Huggingface库开源大语言模型指南 | 【工具】 | https://huggingface.co/learn/nlp-course/chapter1/1 使用Hugging Face Transformers库中的开源大语言模型的指南。 Hugging Face大家应该不陌生,最受欢迎的NLP社区,提供模型与数据集。这门NLP课程结合了他们的框架的学习代码,推荐给需要实践的同学。 |
6 | LangChain文档 | 【工具】 | https://python.langchain.com/docs/get_started/introduction Langchain 是大语言模型最火的应用框架。即使不使用,也可以借鉴。 作为大语言模型应用程序的默认编排层,LangChain连接了堆栈中的几乎所有其他部分。因此,他们的文档是整个堆栈以及各个部分如何配合的真正参考。 |
7 | Building LLM-Powered Apps课程 | 【实战】【app】 |
顺序 | 资源 | 知识分类/使用方法 | 链接和介绍 |
1 | GPT,GPT-2,GPT-3 论文精读 | 【GPT】【论文】 | https://www.bilibili.com/video/BV1AF411b7xQ/?vd_source=72867308e8b7b6d7774a7e4be6278f68 |
2 | Building LLM applications for production | 【app】 | https://huyenchip.com/2023/04/11/llm-engineering.html 在生产环境中构建 LLM 应用。 Chip Huyen讨论了构建大语言模型应用程序的许多关键挑战,如何解决这些挑战以及哪些用例是最合适的。 |
3 | 普林斯顿-COS 597G (Fall 2022): Understanding Large Language Models | 【论文】 | https://www.cs.princeton.edu/courses/archive/fall22/cos597G/ 没找到视频,只有课件 Danqi Chen的课,课程难度较高,主要材料是PPT和相关的论文,适合深入LLM某个方向的同学。 |
4 | 了解sub领域的学术论文 | 【论文】 | https://www.pingwest.com/a/282859 里面提到的论文都在下列这个ZIP文件夹中 https://www.dropbox.com/scl/fi/aoirjyntslo2n2i1rwzo3/LLM-20241124T203225Z-001-2.zip?rlkey=5qiuuyzf11lvbirs5yhnchvpe&st=petbuifx&dl=0 |
5 | Full Stack LLM Bootcamp | 【论文】 | https://fullstackdeeplearning.com/llm-bootcamp/spring-2023/ 由Charles Frye、Sergey Karayev和Josh Tobin主讲的一个实践课程,用于构建基于大语言模型的应用程序。 |
6 | Stanford CS25: V1 I Transformers United: DL Models that have revolutionized NLP, CV, RL | 【论文】 | https://www.youtube.com/watch?v=P127jhj-8-Y 这是关于Transformer的在线研讨会,由斯坦福大学主办。 |
7 | LLM排名和表现对比 | 【工具】 | 【Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings】 https://lmsys.org/blog/2023-05-03-arena/ 由加州大学伯克利分校的团队领导的一种类似Elo积分制的热门LLM排名系统。用户也可以通过比较模型进行头对头比赛来参与其中。 【Open LLM Leaderboard】 https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard 由Hugging Face提供的排名,比较开源LLM在一系列标准基准和任务上的表现。 |