注意力机制是如何“注意”的?一个词看懂上下文背后的秘密
你是否好奇,当 Transformer 模型读一句话时,是如何动态判断“当前这个词,最该参考前面哪几个词”的?这个过程并非魔法,也不是人工编写的规则,而是由 Q、K、V 三个向量 配合训练完成的一套精 …
你是否好奇,当 Transformer 模型读一句话时,是如何动态判断“当前这个词,最该参考前面哪几个词”的?这个过程并非魔法,也不是人工编写的规则,而是由 Q、K、V 三个向量 配合训练完成的一套精 …
在学习循环神经网络(RNN)时,很多初学者在推导数据流时会产生一系列连环疑问: “当前时间步输出的隐藏状态,和传给下一个时间步的信息,是同一份数据吗?” “既然传给下一步了,那当前步的隐藏状态还留着 …
大家好!今天我们来聊聊深度学习中一个非常有趣且重要的概念——循环神经网络(Recurrent Neural Network,简称RNN)。 如果你之前了解过普通的神经网络(比如用来识别图片的CNN), …
PyTorch 作为主流的深度学习框架,在安装时严格区分了 CPU 版本与 GPU 版本。这两个版本对应不同的底层二进制分发包,并非仅通过代码参数进行区分。在实际开发与部署中,准确判断当前环境并进行相 …
在深度学习中,PyTorch 的自动微分(Autograd)机制极大地简化了模型训练过程。在实际的训练代码中,自动微分并不是一个孤立的函数,而是通过一套标准的训练闭环来体现的。 …
很多人入门神经网络,都会卡在“激活函数”这一步。 你可能听过无数遍这句话:加入激活函数,神经网络就能处理非线性问题。但心里大概率藏着一堆问号: 什么是线性?什么是非线性?为什么一条直线就能表示线性问 …