
TensorFlow 2.x 动态序列处理深度实战:tf.TensorArray、tf.while_loop 与变长 RNN/Transformer 的工程化实现
在深度学习的实际工程中,变长序列处理一直是一个令人头疼的问题。无论是 NLP 中的不定长文本、语音识别中的变长音频帧,还是时间序列预测中的不规则采样,都需要我们在计算图中优雅地处理动态形状。TensorFlow 2.x 虽然以 Eager ...

在深度学习的实际工程中,变长序列处理一直是一个令人头疼的问题。无论是 NLP 中的不定长文本、语音识别中的变长音频帧,还是时间序列预测中的不规则采样,都需要我们在计算图中优雅地处理动态形状。TensorFlow 2.x 虽然以 Eager ...

在大语言模型的演进历程中,位置编码(Positional Encoding)始终是一个核心而微妙的问题。Transformer 架构本身是排列等变的,它无法区分“猫追狗”和“狗追猫”——必须通过位置编码注入顺序信息。自 2021 年苏剑林等...
自2017年Google在论文《Attention Is All You Need》中提出Transformer架构以来,它已经彻底改变了自然语言处理乃至整个深度学习的格局。从BERT到GPT,从ViT到CLIP,几乎所有现代大型模型的核心...

从序列建模到线性复杂度:状态空间模型的前世今生 在深度学习领域,Transformer 架构凭借其强大的自注意力机制,几乎统治了自然语言处理、计算机视觉等所有主流任务。然而,Transformer 的核心——自注意力——的计算复杂度是 O(...

MIT 6.S191 深度学习入门免费课程:从神经网络基础到最新AI前沿的完整学习指南 在人工智能领域,MIT(麻省理工学院)的课程一直以高质量著称。其中MIT 6.S191 “Introduction to Deep Lear...
如何通过流水线排布优化摩尔线程 MT-S 系列显卡的 Transformer 算子性能 在国产 GPU 适配过程中,摩尔线程(Moore Threads)的 MUSA 架构表现出色。但要榨干其 MT-S 系列(如 MT-S80/MT-S30...
零基础也能懂:Transformer 核心架构可视化学习指南 作为一名正在自学 AI 的技术博主,我深知直接看论文《Attention Is All You Need》有多痛苦。今天给大家安利一个被全世界 AI 学习者封神的免费资源:Jay...

在过去的几年中,Transformer 架构已经成为深度学习领域最核心的基石,从 NLP 到 CV 再到多模态大模型,几乎无处不在。而注意力机制(Attention)作为 Transformer 的核心组件,其计算复杂度随序列长度呈二次增长...

在大模型时代,掌握NLP(自然语言处理)技术已经成为AI从业者的必备技能。Hugging Face作为全球最大的开源AI社区,提供了一套完全免费的NLP课程——Hugging Face NLP Course,涵盖从Tokenizer到Tra...
Transformer 模型,如 BERT 或其轻量化版本,在自然语言处理任务中表现出色。然而,由于其复杂的矩阵乘法和注意力机制,它们对移动端性能提出了巨大挑战。iPhone 上的神经引擎(ANE)是实现高性能端侧推理的关键,但需要模型以 ...