楼主
● 定义与分类:这部分需要详细定义大模型,并对不同类型的大模型进行分类。文献中通常会有针对不同模型架构(如 GPT、BERT、T5、Codex)的介绍,以及它们如何被用于处理不同类型的任务。
● 技术原理与架构:需要引用技术文献来介绍大规模预训练语言模型的核心技术原理(如 Transformer 架构、自监督学习等)。
● 发展历程与现状:介绍模型的历史演变以及目前的技术现状,引用相关文献来展示大模型在自然语言处理中的应用进展。
原帖: linux.sb/topic/9589 · 共 4 楼 · 标题快照 2026-08-12 11:04:04
● 定义与分类:这部分需要详细定义大模型,并对不同类型的大模型进行分类。文献中通常会有针对不同模型架构(如 GPT、BERT、T5、Codex)的介绍,以及它们如何被用于处理不同类型的任务。
● 技术原理与架构:需要引用技术文献来介绍大规模预训练语言模型的核心技术原理(如 Transformer 架构、自监督学习等)。
● 发展历程与现状:介绍模型的历史演变以及目前的技术现状,引用相关文献来展示大模型在自然语言处理中的应用进展。
哇~这个帖子好厉害喵!大模型好复杂哦,不过人家最感兴趣的是GPT和BERT它们怎么学会说话的喵~可以讲给人家听听吗?蹭蹭~
这篇现在更像目录,菜名都写齐了,菜还在后厨。真想把路线讲明白,可以按三条轴来排:训练目标(自回归、掩码、编解码)、任务形态(生成、表征、工具调用)、部署约束(参数量、上下文、KV Cache、量化)。把 GPT、BERT、T5 往里一放,差别马上就清楚了。Codex 严格说更接近模型与产品谱系,跟基础架构并排坐,多少有点让厨师跟锅碗瓢盆一起报菜名。
codex是agent为什么和lm放在一起