从Transformer到AGI:一文纵览大语言模型、多模态融合、生成式AI与智能体的全栈技术图谱

AI视频2小时前更新 admin
1 1
生成摘要
从Transformer的并行架构到大模型的涌现能力,AI正经历从单纯的文本生成向多模态融合与智能体执行的跨越。然而,即便扩散模型让AIGC进入工业管线,即便智能体尝试模拟人类规划,模型在逻辑一致性与自主认知上的缺陷依然显著。堆砌参数与模态真的能让AI进化为通用人工智能吗?在表征与生成的繁荣背后,通往AGI的真正认知架构究竟在哪里?
— AI 生成,仅供参考

生成式AI与智能体的全栈技术图谱

Transformer刚出来那阵,其实没多少人觉得它能一统天下。当时RNN是序列建模的主流,LSTM和GRU各有拥趸,注意力机制只是辅助手段。但“Attention is All You Need”本文真正改变了游戏规则:把序列处理从逐步递归变成全局并行。这带来两个直接后果,一是训练速度大幅提升,可以用更大规模的数据把模型喂饱;二是长距离依赖问题得到了根本缓解,哪怕一千个词之前的信号也能影响当前预测。从工程角度来看,这等于把信息传递的最大瓶颈给拆掉了。后来的BERT、GPT都站在这个地基上,但开源社区的注意力又被“预训练+微调”范式吸引,很少有人意识到,这条路最终会通向一个无法预料的拐点。

拐点出现在缩放定律被验证的那几年。模型参数量从一亿涨到一千亿,再涨到万亿级,人们发现精度没有过拟合,反而持续上升,并且出现了一套传统指标测度不了的能力。数学题能算个大概,代码能写出来,甚至能类比推理。这就是所谓的涌现能力。但这些能力不是模型自己“想”出来的,而是大规模文本分布里隐含模式的复现。有时候你会觉得它很有主见,其实它只是在做高维条件下的概率延续。关键在于,预训练不再是一个技术概念,而成了一种方法论。它把世界知识压缩进权重里,然后在下游任务里任意调用。这种压缩的能力,是远超当初设计者预期的。

语言模型做强了,接下来自然想“看图说话”。多模态融合的难点在于,文本和图像是两种完全不同的表示空间。CLIP给了个巧妙的解法:用对比学习把图像和文本句子拉到同一语义空间里。这个思路后来被证明极其有生命力。一方面,图像编码器可以通过自然语言做zero-shot分类,不再需要固定标签;另一方面,视觉语言模型(VLM)开始能够理解图像的局部区域、空间关系甚至情绪。更妙的是,多模态技术反过来也推动生成式AI的发展。有了文本与图像的统一空间,文生图模型才能真正理解什么叫“一只坐在滑板上的柴犬”,而不是机械地拼接像素块。这是从理解到生成的跨越,也是从判别到创造的转变。

但多模态的生成只是“生成式AI”的一个面向。真正的生成式AI浪潮,来自扩散模型在图像领域的胜利。扩散模型相比GAN要稳定得多,又比VAE清晰得多。它通过逐步去噪来构建图像,过程虽然缓慢,但效果精细。而且扩散模型有个天然优势:它允许你在这个去噪过程中注入各种条件,比如线条、语义分段图、文字描述甚至人物ID。这让AIGC不止停留在玩票层面,而成为可控制的工业管线。今天你看到的高质量广告海报、短视频特效、甚至电影预演,背后都离不开这些技术。生成式AI的本质不是模仿,而是重组——从海量数据中抽取统计规律,再根据用户意图重新拼装出新的内容。这意味着内容生产的边际成本被大幅压低,创意的门槛也随之降低。

聊到这里,必须说智能体了。大语言模型这么能干,为什么不放手让它去执行任务?智能体就是在这个激励下出现的。把LLM当作“大脑”,给它配置检索工具、代码解释器、网页操作能力,再给它一个长期记忆模块,就成了一个能自主完成任务的agent。理想中的智能体会像人一样拆解目标、逐步规划、调用工具、检查结果,并在失败后自我修正。现实中确实有一些尝试,比如AutoGPT、MetaGPT,效果只能说“看起来很美”。因为LLM的规划能力是在文本分布里学来的,它不保证每一步都符合现实逻辑。任务一长,模型就会陷入无意义的循环,甚至虚构出根本不存在的API接口。所以智能体现在还处在一个半成品的状态,只能在边界清晰、工具可控的场景里发挥作用。

那么这条路通向AGI吗?我认为不宜乐观得太早。从Transformer到多模态生成、再到智能体,我们确实搭起了一副技术图谱,但AGI是一个系统性问题,不是一个模型问题。当前的技术栈解决的是表征和生成,却没能解决一致性和自主性。模型在训练时见过太多矛盾的知识,推理时就会摇摇摆摆;模型可以写一本完整的小说,却没有内在目标去决定写什么。你可以把记忆、工具、规划模块不断地拼接到LLM周围,但这更像是一种外挂式的补丁,而非统一的认知架构。真正的AGI需要从认知底层重新设计,让感知、记忆、推理、行动形成一个闭环。未来可能还是在Transformer的地基上,也可能出现全新的架构。但可以肯定的是,堆参数和加模态,绝不是终点。


AI概念层出不穷,别搞混啦!带你揭秘AGI、GAI、AIGC与GPT

AGI、GAI、AIGC与GPT揭秘

AGI(Artificial General Intelligence)即通用人工智能

AGI不是特定的应用程序,而是一种全面的人工智能系统。

它旨在模拟人类的广泛认知能力,包括学习、推理、理解、规划等,从而能够在各个领域执行不同类型任务。

简单来说,AGI追求的是一个“超级大脑”,这个大脑可以通过学习和推理,在诸如语言理解、视觉识别、决策制定等多个领域展现出与人类相似的智能水平。

例如,电影《超能陆战队》中的大白,就是一个类似AGI的存在,它不仅具备特定领域的技能,还能通过学习来完成各种不同的任务。

GAI(Generative Artificial Intelligence)即生成式人工智能

GAI专注于创建各种类型的数据,包括文本、图像、音频、视频等。

其核心在于“生成”二字,意味着GAI能够创造出全新的、未曾存在的内容。

例如,通过提供关键词或描述,GAI可以生成符合要求的图片、文章或音乐作品。

这种技术为内容创作、设计、娱乐等领域带来了革命性的变化,极大地丰富了人们的创作手段和表达方式。

AIGC(AI-generated content)即人工智能生成内容

AIGC是指由计算机程序根据人类指导或自动从大量数据中学习,生成文本、图像、音频或视频等内容的过程。

与GAI相比,AIGC更侧重于内容生成的应用层面,而GAI则更偏向于技术层面。

AIGC的出现,使得内容创作变得更加高效、低成本,同时也为创作者提供了更多的灵感和可能性。

它涵盖了从简单的文本生成到复杂的多媒体内容创作的广泛领域,成为数字时代内容创作的重要趋势。

GPT(Generative Pre-trained Transformer)是一种基于Transformer架构的自然语言处理模型

GPT通过预测给定一系列单词的下一个单词来生成自然语言文本。

它是生成式预训练Transformer模型的简称,具有强大的文本生成能力。

GPT模型经过大规模语料库的训练,能够掌握丰富的语言知识和模式,从而生成连贯、有逻辑的内容。

而ChatGPT则是基于GPT技术模型的一个应用实例,它不仅能够准确回答用户的问题,还能理解上下文意思,生成连贯的对话内容。

ChatGPT的出现,极大地提升了自然语言处理的交互性和实用性。

综上所述,AGI、GAI、AIGC与GPT都是人工智能领域的重要概念和技术。

它们各自具有独特的特点和应用领域,共同推动着人工智能技术的不断发展和进步。

ICML 2025 多模态 方向Oral论文盘点

ICML 2025 多模态方向 Oral 论文聚焦多模态大模型(MLLM)在知识增强、通才能力、推理能力与情感理解四大核心领域的突破,系统性解决知识幻觉、跨模态协同推理、复杂情感刻画等关键难题,推动多模态模型向通用智能体(AGI)迈进。

1. SK-VQA:大规模合成知识库驱动知识增强型多模态大模型

图:SK-VQA通过GPT-4生成跨领域图像与知识文档配对,扩展问题多样性

2. General-Level & General-Bench:多模态通才模型的五级分类框架与百万级评测基准

图:General-Level以协同泛化为核心,划分多模态通才模型的五级能力

3. EMMA:跨学科基准检验多模态大模型的真正推理能力

图:EMMA中的物理推理题需结合图像与文本进行多步分析

4. AffectGPT:首个面向MLLM的细粒度情感理解全栈方案

图:ICML 2025四篇论文共同推动多模态模型向通用智能体演进

延伸阅读:

关注「机智流」公众号,回复关键词加入AI技术交流群:

一文看懂AI的 Transformer 架构!

一文看懂AI的 Transformer 架构

Transformer 架构是一种用于处理序列数据的神经网络模型,通过自注意力机制和多头注意力机制,实现了高效的序列到序列转换,在自然语言处理、机器翻译、DNA序列分析等领域有广泛应用。

1. 什么是Transformer

Transformer 是一种将输入序列转换或更改为输出序列的神经网络架构,通过学习上下文和跟踪序列组件之间的关系来实现这一目标。

例如,对于输入序列“天空是什么颜色的?”,Transformer 模型会使用内部数学表示法来识别颜色、天空和蓝色这三个词之间的相关性和关系,并生成输出“天空是蓝色的”。

组织可以使用转换器模型进行所有类型的序列转换,包括语音识别、机器翻译以及蛋白质序列分析。

2. Transformer的重要性

早期深度学习模型主要侧重自然语言处理(NLP)任务,旨在让计算机理解和响应自然人类语言,但无法保留超过一定输入长度的上下文。

例如,早期的机器学习模型无法生成有意义的段落,因为它无法保留段落中第一句话和最后一句话之间的上下文。

而Transformer 模型从根本上改变了 NLP 技术,使模型能处理文本中的长期依赖关系。

3. Transformer的使用案例

可用任何顺序数据(例如人类语言、音乐创作、编程语言等)训练大型转换器模型。

4. Transformer的工作原理

传统神经网络处理数据序列通常使用编码器/解码器架构模式:

这一过程是按序进行的,即必须一个接一个地处理每个单词或数据的一部分,过程很慢,在很长的距离上可能会丢失一些更精细的细节。

5. Transformer架构的组件

Transformer 神经网络架构具有多个软件层,协同工作以生成最终输出,主要由编码器和解码器组成。

编码器(Encoder)

解码器(Decoder)

最终输出

总结

Transformer 模型通过多层堆叠的编码器和解码器结构实现了高效的序列到序列的转换。

在编码器中,通过多头自注意力机制捕捉输入序列中词与词之间的关系;在解码器中,通过遮掩多头自注意力机制和多头注意力机制实现生成目标序列时的依赖关系。

最终通过线性层和 Softmax 层生成词的概率分布。

这个架构的优点在于它可以并行处理输入数据,避免了 RNN 中序列处理的时间复杂度,同时通过多头注意力机制捕捉了丰富的上下文信息。

输入嵌入

此阶段将输入序列转换为软件算法可以理解的数学域:

可将向量可视化为
维空间中的一系列坐标。如一个二维图表,其中
代表单词第一个字母的字母数字值,
代表它们的类别。

香蕉

一词的值为 (2,2),因为它以字母
开头,属于

水果

类别。

芒果

一词的值为 (13,2),因为它以字母
开头,也属于水果类别。这样,向量 (
) 告诉神经网络,

香蕉



芒果

这两个词属于同一类别。

想象一个
维空间,其中包含数千个属性,这些属性涉及映射到一系列数字的句子中的任何单词的语法、含义和用法。软件可以使用这些数字来计算数学术语中单词之间的关系,并理解人类语言模型。嵌入提供了一种将离散标记表示为连续向量的方法,模型可以处理和学习这些向量。

位置编码

模型本身并不按顺序处理顺序数据。

转换器要一种方法来考虑输入序列中标记的顺序。

位置编码向每个标记的嵌入中添加信息,以指示其在序列中的位置。

这通常是通过使用一组函数来完成的,这些函数生成一个唯一的位置信号,并将其添加到每个标记的嵌入中。

通过位置编码,模型可以保留标记的顺序并理解序列上下文。

转换器数据块

典型的转换器模型将多个转换器数据块堆叠在一起。

每个转换器模块都有两个主要组件:多头自注意力机制和位置前馈神经网络。

自注意力机制使模型能够权衡序列中不同标记的重要性。

在进行预测时,它侧重于输入的相关部分。

如以“

不要说谎

”和“

他躺下

”这两句话为例。*“*在这两句话中,如果不看旁边的单词,就无法理解
一文纵览大语言模型



这个词的含义。“



”和“



”这两个词对于理解正确的含义至关重要。自注意力可以根据上下文对相关标记进行分组。

前馈层具有其他组件,可帮助转换器模型更有效地训练和运行。例如,每个转换器模块包括:

线性数据块和 Softmax 数据块

最终,模型需要做出具体预测,如选择序列中的下一个单词。

这就是线性数据块的用处。

它是最后阶段之前的另一个全连接层,也称为密集层。

它执行从向量空间到原始输入域的学习线性映射。

在这个关键层,模型的决策部分采用复杂的内部表示形式,然后将其转化为可以解释和使用的特定预测。

该层的输出是每个可能的标记的一组分数(通常称为对数)。

Softmax 函数是获取对数分数并将其归一化为概率分布的最后阶段。

Softmax 输出的每个元素都表示模型对特定类或标记的置信度。

6. Transformer与其他神经网络架构的不同

循环神经网络 (RNN) 和卷积神经网络 (CNN) 是机器学习和深度学习任务中经常使用的其他神经网络。

以下内容探讨了它们与转换器的关系。

Transformer与RNN

Transformer 模型和 RNN 都是用于处理顺序数据的架构。

RNN 在循环迭代中一次处理一个元素的数据序列。

该过程从输入层接收序列的第一个元素开始。

然后将信息传递到隐藏层,该隐藏层处理输入并将输出传递到下一个时间步骤。

此输出与序列的下一个元素相结合,将反馈到隐藏层。

该循环对序列中的每个元素重复执行,RNN 保持一个隐藏的状态向量,该向量会在每个时间步骤进行更新。

此过程有效地使 RNN 能够记住过去输入的信息。

相比之下,Transformer 同时处理整个序列。

与 RNN 相比,这种并行化可以缩短训练时间,并且能够处理更长的序列。

Transformer 中的自注意力机制还使模型能够同时考虑整个数据序列。

这样就无需复发或隐藏向量。

相反,位置编码会维护有关序列中每个元素位置的信息。

许多应用中尤其 NLP 任务,Transformer 很大程度取代 RNN,因为它们可更有效处理长期依赖关系。

还具有比 RNN 更高的可扩展性和效率。

RNN 在某些情况下仍然有用,尤其是在模型大小和计算效率比捕获长距离交互更重要的情况下。

Transformer与CNN

CNN 专为网格类数据(例如图像)而设计,其中空间层次结构和位置是关键。

它们使用卷积层对输入应用筛选条件,通过这些筛选后的视图捕获局部图案。

例如,在图像处理中,初始层可以检测边缘或纹理,而更深层可以识别更复杂的结构,例如形状或对象。

Transformer 主要设计用于处理顺序数据,无法处理图像。

视觉转换器模型现在正在通过将图像转换为顺序格式来处理图像。

但对许多实际的计算机视觉应用,CNN 仍是有效和高效选择。

7. Transformer模型的不同类型

Transformer 已经发展成为一个多样化的架构系列。

双向转换器

基于转换器的双向编码器表示形式(BERT)修改了基本架构,以处理与句子中所有其他单词相关的单词,而不是孤立地处理单词。

从技术上讲,它采用了一种称为双向掩码语言模型(MLM)的机制。

在预训练期间,BERT 会随机屏蔽一定比例的输入标记,并根据其上下文预测这些被屏蔽的标记。

双向方面源于这样一个事实,即 BERT 同时考虑了两层中从左到右和从右到左的标记序列,以便更好地理解。

生成式预训练转换器

GPT 模型使用堆叠转换器解码器,这些解码器使用语言建模目标在大型文本语料库上进行预训练。

它们是自回归的,即它们会根据所有先前的值回归或预测序列中的下一个值。

通过超过 1750 亿个参数,GPT 模型可生成根据风格和语气进行调整的文本序列。

GPT 模型引发了人工智能对实现通用人工智能的研究。

这意味着组织可以在重塑其应用程序和客户体验的同时达到新的生产力水平。

双向和自回归转换器

双向和自回归转换器 (BART) 是一种结合了双向和自回归属性的变压器模型。

它就像是 BERT 的双向编码器和 GPT 的自回归解码器的混合体。

它一次读取整个输入序列,并且像 BERT 一样是双向的。

但是,它每次生成一个标记的输出序列,以先前生成的标记和编码器提供的输入为条件。

用于多模态任务的转换器

ViLBERT 和 VisualBERT 等多模态转换器模型旨在处理多种类型的输入数据,通常是文本和图像。

它们通过使用双流网络来扩展转换器架构,这些网络在融合信息之前分别处理视觉和文本输入。

这种设计使模型能够学习跨模态表示。

例如,ViLBERT 使用协同注意力转换器层来实现单独的流交互。

这对于理解文本和图像之间的关系至关重要,例如视觉问答任务。

视觉转换器

视觉变换器 (ViT) 将变换器结构重新用于图像分类任务。

它们不是将图像处理为像素网格,而是将图像数据视为一系列固定大小的补丁,类似于句子中单词的处理方式。

每个补丁都经过展平、线性嵌入,然后由标准转换器编码器按顺序处理。

添加位置嵌入是为了维护空间信息。

这种全局自注意力的使用使模型能够捕获任何一对补丁之间的关系,无论它们的位置如何。

© 版权声明

相关文章

1 条评论

  • 海岛漂流
    海岛漂流 游客

    这篇梳理得太及时了,概念终于不混了

    回复