<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>深度学习 on Yang</title><link>/categories/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/</link><description>Recent content in 深度学习 on Yang</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><lastBuildDate>Sun, 26 Jul 2026 11:03:00 +0800</lastBuildDate><atom:link href="/categories/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml"/><item><title>MANNs：记忆增强神经网络</title><link>/research/manns/</link><pubDate>Sun, 26 Jul 2026 11:03:00 +0800</pubDate><guid>/research/manns/</guid><description>&lt;img src="/" alt="Featured image of post MANNs：记忆增强神经网络" /&gt;&lt;h2 id="定义"&gt;&lt;a href="#%e5%ae%9a%e4%b9%89" class="header-anchor"&gt;&lt;/a&gt;定义
&lt;/h2&gt;&lt;p&gt;MANNs（&lt;strong&gt;Memory-Augmented Neural Networks，记忆增强神经网络&lt;/strong&gt;）不是某一个固定模型，而是一类带有&lt;strong&gt;可读写记忆模块&lt;/strong&gt;的神经网络架构。&lt;/p&gt;</description></item><item><title>Transformer 中的自注意力机制</title><link>/research/transformer-self-attention/</link><pubDate>Sun, 26 Jul 2026 11:02:00 +0800</pubDate><guid>/research/transformer-self-attention/</guid><description>&lt;h2 id="qkv-是什么"&gt;&lt;a href="#qkv-%e6%98%af%e4%bb%80%e4%b9%88" class="header-anchor"&gt;&lt;/a&gt;Q、K、V 是什么？
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Q（Query，查询）&lt;/strong&gt;：当前位置想寻找什么信息。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;K（Key，键）&lt;/strong&gt;：每个位置能够提供什么信息。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;V（Value，值）&lt;/strong&gt;：每个位置实际携带的信息。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;输入序列表示为：&lt;/p&gt;</description></item><item><title>经典 RNN：循环神经网络</title><link>/research/classic-rnn/</link><pubDate>Sun, 26 Jul 2026 11:01:00 +0800</pubDate><guid>/research/classic-rnn/</guid><description>&lt;img src="/" alt="Featured image of post 经典 RNN：循环神经网络" /&gt;&lt;h2 id="定义"&gt;&lt;a href="#%e5%ae%9a%e4%b9%89" class="header-anchor"&gt;&lt;/a&gt;定义
&lt;/h2&gt;&lt;p&gt;循环神经网络（Recurrent Neural Network，RNN）在生成当前时间步的输出时，会参考之前时间步的信息，从而保留序列中的上下文。&lt;/p&gt;
&lt;p&gt;例如，在预测时间步 $t$ 的输出 $y_t$ 时，需要输入当前时间步的数据 $x_t$，以及时间步 $t-1$ 的隐藏状态 $h_{t-1}$。&lt;/p&gt;</description></item><item><title>LSTM：长短期记忆网络</title><link>/research/lstm/</link><pubDate>Sun, 26 Jul 2026 11:00:00 +0800</pubDate><guid>/research/lstm/</guid><description>&lt;img src="/" alt="Featured image of post LSTM：长短期记忆网络" /&gt;&lt;h2 id="定义"&gt;&lt;a href="#%e5%ae%9a%e4%b9%89" class="header-anchor"&gt;&lt;/a&gt;定义
&lt;/h2&gt;&lt;p&gt;LSTM（Long Short-Term Memory，长短期记忆网络）是 RNN 的一种改进结构，用于缓解普通 RNN 难以保存长期信息以及梯度消失等问题。&lt;/p&gt;
&lt;h2 id="作用"&gt;&lt;a href="#%e4%bd%9c%e7%94%a8" class="header-anchor"&gt;&lt;/a&gt;作用
&lt;/h2&gt;&lt;p&gt;LSTM 通过门控机制选择性地&lt;strong&gt;保留重要信息、写入新信息并遗忘无关信息&lt;/strong&gt;，从而提高对序列数据中长期依赖关系的建模能力。&lt;/p&gt;</description></item></channel></rss>