<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Jiely 的博客</title><description>记录 AI、算法、科研与生活</description><link>https://www.whalefall.top/</link><language>zh-CN</language><item><title>Matrix-黑客帝国</title><link>https://www.whalefall.top/posts/matrix/</link><guid isPermaLink="true">https://www.whalefall.top/posts/matrix/</guid><description>Matrix 的基础知识</description><pubDate>Tue, 04 Aug 2026 07:07:33 GMT</pubDate><content:encoded>&lt;h1&gt;介绍&lt;/h1&gt;
&lt;p&gt;&lt;img src=&quot;https://dns.whalefall.top/matrix1.1.png&quot; alt=&quot;&quot; /&gt;
其实矩阵是一个很深刻的东西，是当代人工智能以及数学领域的一个伟大基石，矩阵是在&lt;strong&gt;线性方程组&lt;/strong&gt;求解中非常重要的东西....，矩阵是在行列式的基础上演变而来的，其实有时候&lt;strong&gt;计算机就是黑魔法，因为总有些天才，高手像魔法师一样变出一些传世的黑魔法&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;标量，向量，矩阵，张量&lt;/h1&gt;
&lt;ul&gt;
&lt;li&gt;标量：数值&lt;/li&gt;
&lt;li&gt;向量：就是一排数
$$
x=
\begin{pmatrix}
x_1\
x_2\
\vdots\
x_n
\end{pmatrix}
$$&lt;/li&gt;
&lt;li&gt;矩阵：二维数组&lt;/li&gt;
&lt;li&gt;张量：可以理解成更高维度的数组&lt;/li&gt;
&lt;/ul&gt;
&lt;h1&gt;矩阵与线性方程组&lt;/h1&gt;
&lt;p&gt;其实就是 线性方程组 去演化成 矩阵形式，
$$
\begin{cases}
a_{11}x_1 + a_{12}x_2 + \cdots + a_{1n}x_n = b_1 \
a_{21}x_1 + a_{22}x_2 + \cdots + a_{2n}x_n = b_2 \
\vdots \
a_{m1}x_1 + a_{m2}x_2 + \cdots + a_{mn}x_n = b_m
\end{cases}
$$
根据这些线性方程组，就可以得到他的&lt;strong&gt;系数矩阵&lt;/strong&gt;：
$$
A=
\begin{bmatrix}
a_{11} &amp;amp; a_{12} &amp;amp; \cdots &amp;amp; a_{1n} \
a_{21} &amp;amp; a_{22} &amp;amp; \cdots &amp;amp; a_{2n} \
\vdots &amp;amp; \vdots &amp;amp; \ddots &amp;amp; \vdots \
a_{m1} &amp;amp; a_{m2} &amp;amp; \cdots &amp;amp; a_{mn}
\end{bmatrix}
$$&lt;/p&gt;
&lt;h1&gt;然后在这个矩阵的右侧加入线性方程组的常数项，就可以构建成&lt;strong&gt;增广矩阵&lt;/strong&gt;：
$$
[A \mid B]&lt;/h1&gt;
&lt;p&gt;\left[
\begin{array}{cccc|c}
a_{11} &amp;amp; a_{12} &amp;amp; \cdots &amp;amp; a_{1n} &amp;amp; b_1 \
a_{21} &amp;amp; a_{22} &amp;amp; \cdots &amp;amp; a_{2n} &amp;amp; b_2 \
\vdots &amp;amp; \vdots &amp;amp; \ddots &amp;amp; \vdots &amp;amp; \vdots \
a_{m1} &amp;amp; a_{m2} &amp;amp; \cdots &amp;amp; a_{mn} &amp;amp; b_m
\end{array}
\right]
$$
这里就涉及一个：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;平凡解：唯一解&lt;/li&gt;
&lt;li&gt;非凡解：无穷解&lt;/li&gt;
&lt;li&gt;齐次方程组：当常数项都为0&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;在齐次方程组中，如果 n &amp;gt; m 则方程有无穷解(非凡解)&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;矩阵算术&lt;/h1&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;加减法：矩阵的每一个元素加减
$$
C_{ij} = A_{ij} + B_{ij}
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;标量乘法
$$
bA \rightarrow (bA)&lt;em&gt;{ij} = b \cdot A&lt;/em&gt;{ij}
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;转置
$$
(A^T)&lt;em&gt;{ij} = A&lt;/em&gt;{ji}
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;矩阵乘法
$$
c_{ij} = \sum_{k=1}^{n} a_{ik}b_{kj}
$$&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;可以理解为左侧矩阵 $A$ 的第 $i$ 行与右侧矩阵 $B$ 的第 $j$ 列对应元素相乘后求和。进行乘法时，必须保证矩阵 $A$ 的列数等于矩阵 $B$ 的行数。&lt;/p&gt;
&lt;h1&gt;范数&lt;/h1&gt;
&lt;h1&gt;我们通常使用&lt;strong&gt;范数&lt;/strong&gt;衡量&lt;strong&gt;向量的大小&lt;/strong&gt;，例如 $L^p$ 范数：
$$
|x|_p&lt;/h1&gt;
&lt;p&gt;\left(
\sum_i |x_i|^p
\right)^{\frac{1}{p}}
$$&lt;/p&gt;
&lt;p&gt;其中，$L_1$ 范数是各元素绝对值之和，也称为&lt;strong&gt;曼哈顿范数&lt;/strong&gt;；$L_2$ 范数对应欧几里得距离；$L_{\infty}$ 范数表示向量中绝对值最大的元素。&lt;/p&gt;
&lt;h2&gt;Frobenuius 范数&lt;/h2&gt;
&lt;p&gt;$$
||A||&lt;em&gt;F = \sqrt{\sum_i\sum_ja&lt;/em&gt;{ij}^2}
$$&lt;/p&gt;
&lt;h1&gt;特殊类型的矩阵&lt;/h1&gt;
&lt;h2&gt;对角矩阵&lt;/h2&gt;
&lt;p&gt;其实就是除了对角，其他元素都为0
$$
D_{ij} = 0 \quad (i \neq j)
$$&lt;/p&gt;
&lt;h2&gt;对称矩阵&lt;/h2&gt;
&lt;p&gt;$$
A = A^T
$$&lt;/p&gt;
&lt;h2&gt;正交矩阵&lt;/h2&gt;
&lt;p&gt;行向量和列向量之间两两&lt;strong&gt;正交&lt;/strong&gt;，并且每个向量的长度为 1（即 $L_2$ 范数为 1）。可以将其理解成&lt;strong&gt;由两两垂直且长度为 1 的列向量组成的方阵&lt;/strong&gt;：
&lt;strong&gt;关键性质&lt;/strong&gt;：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;$A_iA_i^T = 1$&lt;/li&gt;
&lt;li&gt;$A_iA_j^T = 0 \quad (i \neq j)$&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;根据上述性质可以推导出：
$$
AA^T = I
$$&lt;/p&gt;
&lt;p&gt;其中，$I$ 表示单位矩阵。&lt;/p&gt;
&lt;h1&gt;方阵&lt;/h1&gt;
&lt;p&gt;行列数相同的是方阵，&lt;strong&gt;对角矩阵不一定是方阵，长方形的矩阵也可能是对角矩阵（广义）&lt;/strong&gt;&lt;/p&gt;
&lt;h2&gt;单位矩阵&lt;/h2&gt;
&lt;p&gt;单位矩阵其实就是对角元素为1&lt;/p&gt;
&lt;h2&gt;矩阵逆元&lt;/h2&gt;
&lt;p&gt;如果存在一个矩阵:
$$
AB = BA = I
$$&lt;/p&gt;
&lt;p&gt;那么可以称矩阵 $A$ 是非奇异矩阵，也可以说矩阵 $A$ 可逆。&lt;/p&gt;
&lt;h3&gt;奇异矩阵&lt;/h3&gt;
&lt;p&gt;如何快速判断一个矩阵是&lt;strong&gt;非奇异矩阵&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;$A^{-1}$ 存在&lt;/li&gt;
&lt;li&gt;$\det(A) \neq 0$&lt;/li&gt;
&lt;li&gt;$\operatorname{rank}(A) = n$&lt;/li&gt;
&lt;li&gt;$A$ 的行向量和列向量&lt;strong&gt;线性无关&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;$Ax = 0$ 只有零解 $x = 0$&lt;/li&gt;
&lt;li&gt;对于任意 $b$，$Ax=b$ 都有唯一解，因为 $x=A^{-1}b$&lt;/li&gt;
&lt;/ol&gt;
&lt;h4&gt;解释：&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;$\det(A) \neq 0$。行列式可以理解为&lt;strong&gt;线性变换对面积或体积的缩放比例&lt;/strong&gt;；如果比例为 0，空间会被压缩到更低维度，因此无法通过逆变换恢复。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;行列式&lt;/h2&gt;
&lt;p&gt;det 可以理解成 &lt;strong&gt;线性变换对面积的缩放倍数&lt;/strong&gt;，对于一个矩阵，我们可以理解成有 N 个 M 维度的向量，其实就是&lt;strong&gt;正对角元素累乘和-反对角元素累乘和&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;特征值与特征向量&lt;/h1&gt;
&lt;p&gt;这个是一个非常重要的设计&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!NOTE] 在矩阵变化 A 中，能不能找到一些“特殊方向(方向可以理解成向量)”，使得在这些方向上，矩阵只是简单的 放大和缩小？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;其实就是 在 矩阵变化 A 中 找不变量&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
Av = \lambda v
$$
其中，$v$ 是特征向量，$\lambda$ 是特征值。通过&lt;strong&gt;特征分解&lt;/strong&gt;，可以将矩阵分解成一组特征向量和对应的特征值。
，怎么求 这个特征值呢？
$$
Av - \lambda v = 0 \
(A - \lambda I)v = 0 \
det(A - \lambda I) = 0
$$
其实也就是 $A - \lambda I$ 为奇异矩阵，&lt;/p&gt;
&lt;p&gt;所以将 A 转化为：
$$
A = V\Lambda V^{-1}
$$
所以:
$$
Ax = V\Lambda V^{-1}x
$$
x
&lt;strong&gt;矩阵乘一个向量，本质上是 在对矩阵的“列向量”做线性组合&lt;/strong&gt;&lt;/p&gt;
&lt;h2&gt;正定性&lt;/h2&gt;
&lt;p&gt;判断正定：
$$
Q(x) = x^TAx
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;半正定矩阵：所有特征值都是非负&lt;/li&gt;
&lt;li&gt;负定矩阵：所有特征值都是负数&lt;/li&gt;
&lt;li&gt;半负定矩阵：所有特征值都是非正数&lt;/li&gt;
&lt;/ol&gt;
&lt;h1&gt;奇异值分解&lt;/h1&gt;
&lt;p&gt;奇异值分解就是 将 矩阵 A 分解成三个矩阵的乘积&lt;/p&gt;
&lt;p&gt;$$
A = UDV^T
$$
这里 A 是一个 $m \times n$ 的矩阵，U 是一个 $m \times m$ 的矩阵，D 是一个 $m \times n$ 的矩阵，V 是一个 $n \times n$ 的矩阵，这些矩阵都有一些特殊的结构，&lt;strong&gt;U，V是正交矩阵，D是一个对角矩阵&lt;/strong&gt;，D 的对角元素是 A 的奇异值，U 的列向量是 左奇异向量，V的列向量是 右奇异向量&lt;/p&gt;
&lt;p&gt;其实就是&lt;strong&gt;任何一个矩阵的线性变化 都可以理解成 “旋转/反射 -&amp;gt; 拉伸 -&amp;gt; 旋转/反射”&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;向量空间&lt;/h1&gt;
&lt;p&gt;其实就是定义了 矩阵的运算&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;交换律&lt;/li&gt;
&lt;li&gt;结合律&lt;/li&gt;
&lt;li&gt;分配律
但是对于矩阵乘法不能使用交换律，这个运算大部分针对于 常数 和 矩阵的计算&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;子空间&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;一组向量通过线性组合所能产生的所有向量组成的集合，就是其生成空间&lt;/strong&gt;
条件：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;数乘封闭
$$
x \in S \
ax \in S
$$&lt;/li&gt;
&lt;li&gt;加法封闭
$$
x, y \in S \
x + y \in S
$$
重要的结果：所有子空间一定包含 零向量(a=0)，如果要满足上述条件的，比如 在二维空间中&lt;strong&gt;只有经过原点的直线才是子空间&lt;/strong&gt;，这里重点介绍一下&lt;strong&gt;生成空间&lt;/strong&gt;的定义：
$$
\operatorname{span}(v_1,\cdots,v_n)
=
\left{
\sum_{i=1}^{n} c_i v_i
:
c_i \in \mathbb{R}
\right}
$$&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;线性无关&lt;/h2&gt;
&lt;p&gt;对于
$$
Ax = b
$$
是否有解，当且仅当:
$$
b \in Col(A)
$$
,如果要求 任意$b \in \mathbb{R}^m$,Ax = b 都有解，必须满足$Col(A) = \mathbb{R}^m$.
为什么要求 n &amp;gt; m, &lt;strong&gt;因为 $\mathbb{R}^m$ 本身是一个 m 维空间，至少需要 m 个独立方向(因为b 相当于 n 个 m 维度的列向量线性组合)&lt;/strong&gt;，并且线性无关才行。&lt;/p&gt;
&lt;h4&gt;线性相关要求：&lt;/h4&gt;
&lt;p&gt;一组 向量: $v_1,....,v_n$,
对于 一组 &lt;strong&gt;不全为 0 的系数&lt;/strong&gt;:$c_1,....,C_n$,
使得:
$$
c_1v_1 + c_2v_2 + ... + c_nv_n = 0
$$
，&lt;strong&gt;对于一个维度为m 的空间最多只有 m 个线性无关的向量&lt;/strong&gt;，这个很好理解，就是对于 一个 m 维 的空间 相当于只有 m 个 基向量 就可以组成 这个 空间中的所有向量，所以 Rank(A) &amp;lt;= min(n, m),又因为 最多m 个 线性无关向量，要满足 b 是 在这个 空间中，最少需要 m 个 线性无关向量，所以 只有 Rank(A) = m 的时候 这个 b 才能满足。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!NOTE]
最重要的部分，我看完B 站视频再补充，这个 梯度对于深度学习的设计非常重要&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h1&gt;雅可比矩阵(Jacobian)&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;一阶导数矩阵&lt;/strong&gt;，其实要理解这个 雅可比矩阵，我们应该考虑&lt;strong&gt;极限 + 导数&lt;/strong&gt;，在一个 &lt;strong&gt;极小的位置，F(x) 对 x 的影响 可以看成 线性变换&lt;/strong&gt;
$$
\Delta y \approx J\Delta x
$$&lt;/p&gt;
&lt;p&gt;比如输入 $X \in \mathbb{R}^n$:
$$
x=
\begin{bmatrix}
x_1\
x_2
\end{bmatrix}
$$
然后输出结果是$Y \in \mathbb{R}^m$:
$$
y=
\begin{bmatrix}
y_1\
y_2\
y_3
\end{bmatrix}
$$
,&lt;strong&gt;Jacobian 就是把所有偏导数组成矩阵&lt;/strong&gt;,相当于&lt;strong&gt;第 j 个输出，对第 i 个输入端变化敏感度&lt;/strong&gt;,
$$
J=\frac{\partial y}{\partial x} \quad, J \in \mathbb{R}^{m \times n}
$$
矩阵的展开形式:
$$
J=
\begin{bmatrix}
\frac{\partial y_1}{\partial x_1}
&amp;amp;
\frac{\partial y_1}{\partial x_2}
&amp;amp;
\cdots
&amp;amp;
\frac{\partial y_1}{\partial x_n}
\
\frac{\partial y_2}{\partial x_1}
&amp;amp;
\frac{\partial y_2}{\partial x_2}
&amp;amp;
\cdots
&amp;amp;
\frac{\partial y_2}{\partial x_n}
\
\vdots
&amp;amp;
\vdots
&amp;amp;
\ddots
&amp;amp;
\vdots
\
\frac{\partial y_m}{\partial x_1}
&amp;amp;
\frac{\partial y_m}{\partial x_2}
&amp;amp;
\cdots
&amp;amp;
\frac{\partial y_m}{\partial x_n}
\end{bmatrix}
$$&lt;/p&gt;
&lt;h1&gt;Hessian 矩阵(Hessian)&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;二阶导数矩阵&lt;/strong&gt;，
&lt;a href=&quot;https://paul.pub/the-matrix/#id-%E5%AF%B9%E7%A7%B0%E7%9F%A9%E9%98%B5&quot;&gt;参考资料&lt;/a&gt;&lt;/p&gt;
</content:encoded></item><item><title>动手学机器学习</title><link>https://www.whalefall.top/posts/ml/</link><guid isPermaLink="true">https://www.whalefall.top/posts/ml/</guid><description>动手还是动脚</description><pubDate>Wed, 12 Aug 2026 09:40:00 GMT</pubDate><content:encoded>&lt;blockquote&gt;
&lt;p&gt;[!NOTE]
关于机器学习的学习，查漏补缺:)&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h1&gt;初探机器学习&lt;/h1&gt;
&lt;p&gt;机器通过&lt;strong&gt;经验数据&lt;/strong&gt; 对任务目标做出优化的自动化过程，学习就是 &lt;strong&gt;系统基于数据来提升既定指标分数的过程&lt;/strong&gt;，这个也是目前&lt;strong&gt;LLM&lt;/strong&gt;领域比较突出问题，就是 &lt;strong&gt;数据质量&lt;/strong&gt;，对于传统的机器学习和深度学习的模型检测都有一些标准的人为划分的数据集用来进行模型的训练，但是 &lt;strong&gt;LLM&lt;/strong&gt; 需要的数据很庞大，而且需要进行不断的迭代更新，尤其是 标准的文本式问答，这种数据集并没有一个 固定单一的答案，缺乏一个 明确的监督信号是 大模型目前一个深刻的问题。&lt;/p&gt;
&lt;p&gt;机器学习是一门研究算法的学科，能够非显式编程(显示编程是自己有一个解决方案用代码实现，非显式是自迭代拟合实验数据)的形式，通过经验数据来提升性能指标，数学描述机器学习的形式是:
$$
f^* = arg maxP (D, f) = ML(D)
$$
数据集为 D，在给定的模型空间$f$ 中，寻找最大化性能指标的预测模型 $f^&lt;em&gt;$， 对于上述的优化范式中，我们在一个 模型空间$f$中寻找最优模型 $f^&lt;/em&gt;$，可以理解成一个 持续迭代的形式，这个&lt;strong&gt;寻找最优模型的过程就是 机器学习&lt;/strong&gt;，我的理解就是**让模型去拟合数据，提高在数据集上的表现能力。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;https://dns.whalefall.top/ML1.1.png&quot; alt=&quot;&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;机器学习类别&lt;/h2&gt;
&lt;h3&gt;分类：离散&lt;/h3&gt;
&lt;h3&gt;回归：连续&lt;/h3&gt;
&lt;h3&gt;监督学习&lt;/h3&gt;
&lt;p&gt;训练集D中每个数据样本(x,y)由特征和标签组成，模型任务是根据这个 数据特征 来预测 这个标签样本，模型的性能用损失函数来评估，就是
$$
f^* = \arg\min_f \frac{1}{|D|} \sum_{(x,y)\in D} L(y, f(x))
$$&lt;/p&gt;
&lt;h3&gt;无监督学习&lt;/h3&gt;
&lt;p&gt;其实无监督相当于有监督，就是 数据样本没有标签，每个数据集只有 特征 x，我们方法要根据概率分布p(x)，去建模数据的分布，可以理解成&lt;strong&gt;没有标准答案，让模型自己去找数据中的规律&lt;/strong&gt;，比如：1000 张图片中可能有很多动物，让你根据这些图片的特征去进行分类（同一类别会有相似性），其实就是去学习数据特征&lt;/p&gt;
&lt;p&gt;$$
p^* = \arg\max_p \frac{1}{|D|} \sum_{x\in D} \log p(x)
$$
这个p(x) 其实是表示 数据的概率&lt;/p&gt;
&lt;h3&gt;参数化/非参数化模型&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;模型需要多少个自由度来描述，是否随着训练数据量的增加二增加
参数化模型:其实就是相当于参数矩阵(向量)是固定的，将数据的特征压缩到固定大小的参数中
$$
\theta^* = \arg\min_\theta \frac{1}{|D|} \sum_{(x,y)\in D} L(y, f_\theta(x))
$$
非参数化模型:其实就是将数据特征通过聚合处理变成一个更适合模型的数据特征&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;泛化能力&lt;/h2&gt;
&lt;h1&gt;模型不仅要“记住训练数据”，还要能在没见过的新数据上做对，这个是模型非常重要的一个性质，也是用来避免模型的表达能力仅拟合数据集，导致的&lt;strong&gt;过拟合&lt;/strong&gt;现象
$$
R(f)&lt;/h1&gt;
&lt;h1&gt;\mathbb{E}_{(x,y)\sim p(x,y)}
\left[
L(y,f(x))
\right]
$$
这个 x 其实就是样本，这个 p(x,y) 就是 这个样本在真实事件出现的概率，但是其实这就存在一个问题，你可能并不知道 “整个真实世界的数据分布”，那我其实不能去计算这个值，只能计算 &lt;strong&gt;经验风险&lt;/strong&gt;:
$$
\hat{R}(f)&lt;/h1&gt;
&lt;p&gt;\frac{1}{n}
\sum_{i=1}^{n}
L(y_i,f(x_i))
$$
这个其实才是我们能够评估的指标，其实 泛化的本质 就是希望模型的能力 不仅仅限制于数据集，而是能够真正去面对不同的问题，对于&lt;strong&gt;泛化能力&lt;/strong&gt;，我的总结便是&lt;strong&gt;相似的事物有相似的特征，如果模型能否真正的提取这些特征&lt;/strong&gt;，模型的空间越复杂，其建模的能力就越强，就需要足够多样，强的数据用来模型训练。&lt;/p&gt;
&lt;h2&gt;归纳偏置:机器学习模型的“天赋”&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;回答的问题：当训练数据有限的时候，模型怎么对没见过的数据进行预测&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当模型看数据的时候，会有一些自己的“理解”，或者说是规则，比如 经过数据训练，他可能会认为数据是一个 线性 的，那么新来的数据他也会认为是一个 线性的结果，y=kx，其实我认为机器学习可能就类似于一个&lt;strong&gt;数学建模&lt;/strong&gt;的过程，就是对当前这个问题进行建模，然后 y = f(x 这种形式得到结果，经过数据训练，这个 f(.) 可能就会不同，其实就是模型的f(.) 就是 &lt;strong&gt;Inductive Bi)as&lt;/strong&gt;，叫归纳偏置
&lt;img src=&quot;https://dns.whalefall.top/ML1.2.png&quot; alt=&quot;&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;机器学习的限制&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;其实对于机器学习来说，就是构建一个模型去拟合数据集的过程，其实如果数据集的质量不高，数量不够很难让模型有一个泛化能力，反而可能让模型崩溃，可能只认识这一个数据，其他内容，我对机器学习有一个深刻理解再说，我认为数据其实是 当前技术的一个很大的难关。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;机器学习 其实全名叫 统计机器学习，可以理解 成 &lt;strong&gt;机器学习其实是在学习数据中的一些规律，让 模型去 拟合这个数据规律&lt;/strong&gt;，所以叫 &lt;strong&gt;统计&lt;/strong&gt;，大概率发生的事件内在肯定存在一些固有独立的特征。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h1&gt;监督学习设定(Supervised Learning set up)&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!NOTE]
监督学习就是 在我们有 训练数据，学习数据中规律，通过数据映射得到结果，其实就是 学习一种映射关系&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$$
X \rightarrow F(X) \rightarrow Y
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;经验风险最小化：控制预测结果和实际结果的误差，其实就是 最小化损失函数&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;线性回归&lt;/h2&gt;
&lt;h3&gt;损失函数(目标函数):&lt;/h3&gt;
&lt;p&gt;$$
J(\theta) = \frac{1}{2} \sum_{1}{n}(F_{\theta}(X^{(i)}) - y^{(i)})^2
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;这个 平方项 是为了 &lt;strong&gt;放大 大误差，缩小小误差 的影响&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;$\frac{1}{2}$ 其实是为了后续的导数计算方便简洁，换成其他并没有影响&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;梯度更新&lt;/h3&gt;
&lt;h1&gt;$$
\theta_j^{(t+1)}&lt;/h1&gt;
&lt;h2&gt;\theta_j^{(t)}&lt;/h2&gt;
&lt;p&gt;\alpha
\frac{\partial}{\partial \theta_j}
J(\theta^{(t)})
$$
相当我们是在找 $\theta$ 让 $J(\theta)$ 越来越小，所以根据 泰勒展开的形式，
$$
J(\theta + \Delta) \approx J(\theta) + J^{&apos;}(\theta)\Delta\theta
$$
我们希望 $J(\theta + \Delta)$ 比原来更小，就是 这个 $J^{&apos;}(\theta)\Delta\theta &amp;lt; 0 $,最简单的设计:
$$
\Delta\theta = -\alpha J^{&apos;}(\theta)
$$
,这个 \alpha 也叫做 step size(步长，学习率)，但是这样的设计 会容易陷入 &lt;strong&gt;局部最优&lt;/strong&gt;，
&lt;img src=&quot;https://dns.whalefall.top/ml2.1.png&quot; alt=&quot;&quot; /&gt;&lt;/p&gt;
&lt;h4&gt;随机梯度下降&lt;/h4&gt;
&lt;p&gt;条件：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;数据样本反映真实世界&lt;/li&gt;
&lt;li&gt;小批量样本反映总体样本&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;随机采样进行梯度更新
SGD:
$$
\theta^{t + 1} = \theta^t - \alpha_B \sum_{j \in B}(h_\theta(x^{(j)}) - y^{(j)})x^{(j)}
$$&lt;/li&gt;
&lt;/ol&gt;
&lt;h4&gt;正式推导&lt;/h4&gt;
&lt;h1&gt;设计
$$
X\theta =
\begin{pmatrix}
h(x^{(1)})\
h(x^{(2)})\
\vdots\
h(x^{(n)})
\end{pmatrix}
$$
引入 如上的 损失函数设:
$$
J(\theta)=\frac{1}{2}(X\theta-y)^T(X\theta-y)
$$
这个才是 进行 代码实现中的设计，一般都是通过矩阵的形式实现,通过引入 导数矩阵:
$$
\nabla_A f(A)&lt;/h1&gt;
&lt;p&gt;\begin{pmatrix}
\frac{\partial}{\partial a_{11}}f(A)&amp;amp;
\frac{\partial}{\partial a_{12}}f(A)&amp;amp;
\cdots&amp;amp;
\frac{\partial}{\partial a_{1d}}f(A)
\
\frac{\partial}{\partial a_{21}}f(A)&amp;amp;
\frac{\partial}{\partial a_{22}}f(A)&amp;amp;
\cdots&amp;amp;
\frac{\partial}{\partial a_{2d}}f(A)
\
\vdots&amp;amp;\vdots&amp;amp;\ddots&amp;amp;\vdots
\
\frac{\partial}{\partial a_{n1}}f(A)&amp;amp;
\frac{\partial}{\partial a_{n2}}f(A)&amp;amp;
\cdots&amp;amp;
\frac{\partial}{\partial a_{nd}}f(A)
\end{pmatrix}
$$&lt;/p&gt;
&lt;p&gt;在这个部分，我么能不能知道 最优点 的位置:
引入 $\nabla_{\theta} J(\theta)$
所以:
$$
\nabla_{\theta}J(\theta) = \nabla_{\theta}\frac{1}{2}(X \theta - y)^{T}(X \theta - y)
$$
根据拆分合并得到的:
$$
J(\theta) = \frac{1}{2}(\theta^TX^TX\theta - 2 \theta^TX^Ty + y^Ty)
$$
矩阵求导后的结果:
$$
\nabla_{\theta}J(\theta) = X^TX\theta - X^Ty
$$
解出$\theta$
$$
\theta = (X^TX)^{-1}X^T
$$&lt;/p&gt;
&lt;h2&gt;分类问题&lt;/h2&gt;
&lt;p&gt;跟线性回归不同，线性回归的数据为连续数据，分类问题的数据可能是离散的数据&lt;/p&gt;
&lt;h3&gt;临时插话&lt;/h3&gt;
&lt;h4&gt;优惠卷收集者问题&lt;/h4&gt;
&lt;p&gt;常见的数据很容易遇到，罕见的数据很难遇见，&lt;strong&gt;真正想要的东西却始终遇不到&lt;/strong&gt;，&lt;/p&gt;
&lt;h4&gt;DFS(直接反馈对齐)&lt;/h4&gt;
&lt;p&gt;参考资料：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href=&quot;https://hml.boyuai.com/&quot;&gt;动手学机器学习&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;CS229vb&lt;/li&gt;
&lt;/ul&gt;
</content:encoded></item><item><title>动手学深度学习</title><link>https://www.whalefall.top/posts/2026-01-27-dl/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2026-01-27-dl/</guid><description>浅学一下，了解一下</description><pubDate>Tue, 27 Jan 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;预备知识&lt;/h1&gt;
&lt;p&gt;参考资料：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href=&quot;https://zh.d2l.ai/&quot;&gt;相关学习链接&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</content:encoded></item><item><title>梦幻八月冲刺</title><link>https://www.whalefall.top/posts/2026-08-16-my-new-post/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2026-08-16-my-new-post/</guid><description>关于后续的安排计划</description><pubDate>Sun, 16 Aug 2026 03:23:24 GMT</pubDate><content:encoded>&lt;blockquote&gt;
&lt;p&gt;[!NOTE]
相关笔记会进行每日更新&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h1&gt;8月份计划&lt;/h1&gt;
&lt;h2&gt;CS229&lt;/h2&gt;
&lt;h2&gt;D2L&lt;/h2&gt;
&lt;h2&gt;博客更新计划：&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;文章排序根据更新时间排序(目前是 发表时间)，内容显示要美观(鼠标在这个位置就可以显示详细的更改时间，否则就精确到日)&lt;/li&gt;
&lt;li&gt;将博客设计一个 html 方便我本地进行部署，新建文件内容，上传项目，不依赖于终端&lt;/li&gt;
&lt;/ol&gt;
</content:encoded></item><item><title>日常</title><link>https://www.whalefall.top/posts/day0805/</link><guid isPermaLink="true">https://www.whalefall.top/posts/day0805/</guid><description>真得写博客吧，一写发现好多不懂，全是漏洞😭...</description><pubDate>Wed, 05 Aug 2026 08:42:29 GMT</pubDate><content:encoded>&lt;p&gt;发现一写博客，发现好多东西都不懂，然后写完这篇又想跟着这篇不懂的再去写新的，一直一直挖，我感觉都写不完了，好多😭&lt;/p&gt;
&lt;p&gt;写博客应该要有的思路:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;把问题和回答搞清楚&lt;/li&gt;
&lt;li&gt;表达要清晰，不要写流水账(可以写一点流水账)，但是技术介绍部分不要写流水账，可以单独写一段的流水账&lt;/li&gt;
&lt;li&gt;博客最好可以配图，用 AI 帮你配一下图&lt;/li&gt;
&lt;li&gt;主要是帮助自己总结，把问题理清楚&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;a href=&quot;https://dns.whalefall.top/think_me.jpg&quot;&gt;&lt;/a&gt;&lt;/p&gt;
</content:encoded></item><item><title>矩阵:高维世界表示</title><link>https://www.whalefall.top/posts/aj/</link><guid isPermaLink="true">https://www.whalefall.top/posts/aj/</guid><description>为什么矩阵能够表示高维信息？</description><pubDate>Tue, 04 Aug 2026 02:31:30 GMT</pubDate><content:encoded>&lt;blockquote&gt;
&lt;p&gt;[!NOTE]
为什么矩阵能够表示高维信息，为什么线性变化是在改变特征坐标系?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;依旧前面是 AI，后面是流水账(不断改进自己的表达!)&lt;/p&gt;
&lt;h1&gt;矩阵的设计&lt;/h1&gt;
&lt;p&gt;首先，我们可以将矩阵简单理解为一个二维表格：&lt;/p&gt;
&lt;p&gt;$$
A \in \mathbb{R}^{N\times D}
$$&lt;/p&gt;
&lt;p&gt;那么，为什么一个二维表格能够表示高维度的信息呢？&lt;/p&gt;
&lt;p&gt;关键在于：&lt;strong&gt;矩阵中的每一行（或每一列）其实都是一个高维向量。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;例如，在 Embedding 中，一个文本经过编码后，会被表示为一个：&lt;/p&gt;
&lt;p&gt;$$
x \in \mathbb{R}^{1\times D}
$$&lt;/p&gt;
&lt;p&gt;的向量。其中，$D$ 表示向量维度。&lt;/p&gt;
&lt;p&gt;如果一个矩阵包含 $N$ 个词的表示：&lt;/p&gt;
&lt;p&gt;$$
A=
\begin{bmatrix}
x_1\
x_2\
\vdots\
x_N
\end{bmatrix}
\in \mathbb{R}^{N\times D}
$$&lt;/p&gt;
&lt;p&gt;那么它本质上表示：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;N 个对象，每个对象由 D 维特征描述。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;为什么一个 D 维向量可以表示一个词？&lt;/h2&gt;
&lt;p&gt;一个词本身并没有明确的数学属性，例如“苹果”这个词并不存在天然的：&lt;/p&gt;
&lt;p&gt;$$
[\text{颜色},\text{大小},\text{类别}]
$$&lt;/p&gt;
&lt;p&gt;这样的特征。&lt;/p&gt;
&lt;p&gt;Embedding 的核心思想是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;通过学习，将语义信息映射到高维空间中。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如 Word2Vec，通过大量文本上下文学习词之间的关系，使得语义相似的词在向量空间中更加接近：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;“苹果”和“香蕉”的距离较近；&lt;/li&gt;
&lt;li&gt;“苹果”和“汽车”的距离较远。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这里的&lt;strong&gt;距离&lt;/strong&gt;成为衡量语义关系的重要工具。&lt;/p&gt;
&lt;p&gt;因此，一个词向量可以理解为：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;一个词在高维语义空间中的坐标。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;矩阵之所以能够表示复杂信息，本质上是因为：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;它为每一个对象构建了一个高维坐标，并利用坐标之间的关系表示信息。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h1&gt;矩阵的线性变换&lt;/h1&gt;
&lt;p&gt;矩阵最重要的能力之一，就是进行&lt;strong&gt;线性变换&lt;/strong&gt;：&lt;/p&gt;
&lt;p&gt;$$
y=Ax
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$x$：原始特征；&lt;/li&gt;
&lt;li&gt;$A$：变换矩阵；&lt;/li&gt;
&lt;li&gt;$y$：新的特征表示。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;从数学角度看，矩阵乘法实际上是在重新组合原始特征。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;p&gt;$$
x=
\begin{bmatrix}
\text{物理能力}\
\text{数学能力}
\end{bmatrix}
$$&lt;/p&gt;
&lt;p&gt;经过线性变换：&lt;/p&gt;
&lt;p&gt;$$
y=Ax
$$&lt;/p&gt;
&lt;p&gt;可能得到：&lt;/p&gt;
&lt;p&gt;$$
y=
\begin{bmatrix}
\text{综合能力}\
\text{物理-数学差异}
\end{bmatrix}
$$&lt;/p&gt;
&lt;p&gt;也就是说，原来的特征空间：&lt;/p&gt;
&lt;p&gt;$$
[\text{物理},\text{数学}]
$$&lt;/p&gt;
&lt;p&gt;被转换成了新的特征空间：&lt;/p&gt;
&lt;p&gt;$$
[\text{综合能力},\text{差异}]
$$&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;坐标系转化的理解&lt;/h2&gt;
&lt;p&gt;线性变换可以理解为：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;不断改变数据的表示坐标系，使信息更加符合当前任务的需求。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;原始空间中，我们可能关注：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;单独的物理能力；&lt;/li&gt;
&lt;li&gt;单独的数学能力。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;经过变换后，模型可能发现：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;综合能力更重要；&lt;/li&gt;
&lt;li&gt;两者之间的差异更有意义。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此，深度学习中的矩阵计算，本质上是在不断学习：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;什么样的特征空间更适合当前任务。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在 Transformer 中，线性层和注意力机制也可以理解为：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;不断重新组织语义空间，让模型在新的表示空间中理解信息。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;信息本身没有增加，只是&lt;strong&gt;编码方式发生了变化。&lt;/strong&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h1&gt;矩阵中的不变量&lt;/h1&gt;
&lt;p&gt;虽然矩阵可以改变数据表示，但一些结构信息不会轻易改变，这些称为矩阵的不变量。&lt;/p&gt;
&lt;h2&gt;1. 线性结构&lt;/h2&gt;
&lt;p&gt;线性变换保持基本的空间关系。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;三点共线；&lt;/li&gt;
&lt;li&gt;向量之间的线性关系。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;经过线性变换后，这些关系仍然存在。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;2. Rank（秩）&lt;/h2&gt;
&lt;p&gt;矩阵的秩表示：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;数据中真正独立的信息数量，也就是空间自由度。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;p&gt;如果一个二维数据实际上都落在一条直线上：&lt;/p&gt;
&lt;p&gt;$$
\text{rank}=1
$$&lt;/p&gt;
&lt;p&gt;说明虽然数据存在二维坐标中，但真正有效的信息只有一个方向。&lt;/p&gt;
&lt;p&gt;无论如何进行线性变换，这种自由度不会凭空增加。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 特征值与特征向量&lt;/h2&gt;
&lt;p&gt;特征值是矩阵中非常重要的结构信息。&lt;/p&gt;
&lt;p&gt;满足：&lt;/p&gt;
&lt;p&gt;$$
Ax=\lambda x
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$x$ 是特征向量；&lt;/li&gt;
&lt;li&gt;$\lambda$ 是特征值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它表示：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;某些特殊方向经过矩阵变换后，只发生缩放，而不会改变方向。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此，特征值反映了矩阵对不同方向的信息放大或压缩程度。&lt;/p&gt;
&lt;p&gt;在深度学习中，特征值常用于分析：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;信息传播；&lt;/li&gt;
&lt;li&gt;稳定性；&lt;/li&gt;
&lt;li&gt;过平滑现象；&lt;/li&gt;
&lt;li&gt;表示空间变化。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;总结&lt;/h1&gt;
&lt;p&gt;矩阵能够表示高维信息的核心原因是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;矩阵中的每一个向量都是高维空间中的一个坐标，而整个矩阵描述了大量对象之间的关系。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;矩阵乘法的核心意义是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;通过线性变换不断改变坐标系，重新组织特征表示，使信息更容易被模型理解。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而矩阵的不变量（如秩、特征值等）则描述了：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;在不断变化的表示空间中，哪些信息结构始终保持。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h1&gt;流水账&lt;/h1&gt;
&lt;h2&gt;矩阵的设计&lt;/h2&gt;
&lt;p&gt;首先其实我们可以知道，其实矩阵可以理解成一个二维表格，那他为什么能够表示更高维度的信息呢？
$$
A = [], N \times D
$$
其实这个在 用 Embedding 的角度去理解的话，就是 Embedding 的设计 就是将文本变成 一个 [1 * D] 的向量形式，也就是矩阵形式，所以相当于一个矩阵，其实就是 有 N 个词，然后每一个词用 D 维度的 向量表示，为什么能够用 D 维度的向量去表示一个词呢？这个 D 维度的 向量真的能够刻画一个词的性质吗？其实是真的可以的，比如 Word2Vec(好像是这个名字)，非常NB的词嵌入设计，[1 * D] 的向量其实放到坐标系中可以理解成一个 坐标，那如果把词看成坐标，怎么去刻画 词之间的关系呢？引入了坐标系中最重要的设计:&lt;strong&gt;距离&lt;/strong&gt;，这个距离就是用来刻画 词之间的关系的，词相关程度高，距离也就会更近，这个我在前面的文章中其实有解释过，好像是那个&quot;GPT 为什么会胡言乱语 的文章中&quot;&lt;/p&gt;
&lt;p&gt;通过这种理解，其实我的理解就是 $N \times D$ 的矩阵中，可以表示有 N 个 D 维度的向量，然后每一个 向量 其实可以理解成一个特征，所以叫特征向量，其实我认为最为巧妙的就是，将**特征(可能是描述事物)**转变成一个高维度的向量，这个其实也是 矩阵为什么能够表示高维度信息，其实他本身就是对每一个特征构建的一个高维坐标系&lt;/p&gt;
&lt;h2&gt;矩阵的线性变化&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!NOTE]
为什么矩阵的线性变化其实是矩阵最为重要的设计，也是他能够应用在 深度学习的一个重要角度&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;首先我举一个简单的例子:
$$
X = Ax
$$
如果这个 x 是一个 $N \times D$ 维度的向量，其实 这个 A 就是对这个 x 做了一个线性变化，其实就是 行列之间的求和变化啥的，这个其实就是很厉害的一个点，就是行列之间的操作&lt;/p&gt;
&lt;h3&gt;坐标系转化&lt;/h3&gt;
&lt;p&gt;其实 可以将 线性变化 可以理解成&lt;strong&gt;特征性质改变(坐标系改变)&lt;/strong&gt;，其实如果一开始的特征如果是[物理，数学]，两种特征，但是如果 进行了线性变化，其实可能特征就变成了[综合能力，物理和数学的差异]，这两种特征形式，其实就是 旋转一下坐标系，如下图所示:
&lt;img src=&quot;https://dns.whalefall.top/A1.png&quot; alt=&quot;&quot; /&gt;&lt;/p&gt;
&lt;p&gt;其实线性变化的意思就是在不断的更换坐标系，换成目前的模型能够很好的处理的特征，我认为这个角度真的很有意思，不断的去改变坐标系，在 &lt;strong&gt;Transformer 的角度，其实就是在不断的组织语义空间&lt;/strong&gt;，其实信息总量是没有改变的，只是编码的方式改变了&lt;/p&gt;
&lt;h2&gt;矩阵中的不变量&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;向量的空间结构: 始终保持的这个线性关系，比如 三点共线，进行线性变化以后还是共线的&lt;/li&gt;
&lt;li&gt;Rank(秩): 其实是表示 矩阵的&lt;strong&gt;自由度&lt;/strong&gt;，比如 在某一个坐标系中，所有特征都在一个圆内，无论怎么进行线性变化，这个节点都会在一个圆内&lt;/li&gt;
&lt;li&gt;特征值: 其实也是矩阵最重要的一个东西，相当于可以理解成，把矩阵中最为重要的不变的信息给提取出来的
$$
Ax = \lambda x
$$
这个 $\lambda$ 就是 特征值，其实也是认为是矩阵的一个表示特性&lt;/li&gt;
&lt;/ol&gt;
</content:encoded></item><item><title>Hermes-EM：自迭代多 Agent 金融情绪市场仿真与风险感知交易</title><link>https://www.whalefall.top/posts/hermes-em-knowledge-graph-report/</link><guid isPermaLink="true">https://www.whalefall.top/posts/hermes-em-knowledge-graph-report/</guid><description>将金融情绪传播、多 Agent 仿真、风险感知交易和经验保留组织为可追踪的知识与决策闭环。</description><pubDate>Fri, 31 Jul 2026 00:30:00 GMT</pubDate><content:encoded>&lt;p&gt;西南财经大学计算机与人工智能学院&lt;br /&gt;
School of Computing and Artificial Intelligence, SWUFE&lt;br /&gt;
期末报告&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Hermes-EM：自迭代多 Agent 金融情绪市场仿真与风险感知交易&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;42311102刘勇杰&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;金融市场中的价格波动并不只来自历史行情和基本面信息，新闻事件、社交传播、投资者注意力、订单簿结构和交易主体行为共同构成了复杂的金融大数据环境。传统算法交易系统通常依赖历史行情回测或价格动量信号，难以在可控条件下复现新闻冲击、社交过热、短线资金撤退和流动性收缩等情绪驱动场景；已有市场仿真又往往停留在现象展示层面，缺少与风险感知交易 Agent 的闭环连接。针对这一问题，本文提出 Hermes-EM，一个面向算法交易研究的多 Agent 情绪市场仿真框架。该框架以 A 股交易规则和异质投资者行为为约束，构造新闻事件、社交传播、订单簿撮合、群体情绪和价格反馈之间的动态循环，并将 Hermes Quant Agent 嵌入该仿真市场中进行观察、决策、复盘和经验更新。实验以“涨停失败/主力诱多”场景为例，展示价格情绪曲线、社交传播链、微观结构信号和策略财富曲线。结果表明，Hermes 情绪感知策略能够在社交过热、传闻扩散和流动性下降阶段主动降低风险暴露，最终取得 1.66% 的收益率和 0.28% 的最大回撤；相比之下，追涨动量基线收益率为 -5.10%，最大回撤为 6.72%。该结果说明，多 Agent 仿真市场可为算法交易 Agent 提供可控、可解释、可复盘的情绪风险测试环境。代码仓库：&lt;a href=&quot;https://github.com/HanaViolet/Hermes-EM&quot;&gt;HanaViolet/Hermes-EM&lt;/a&gt;。&lt;/p&gt;
&lt;p&gt;多 Agent 仿真；算法交易；金融大数据；情绪市场；投资者情绪；风险感知决策&lt;/p&gt;
&lt;h1&gt;1 引言&lt;/h1&gt;
&lt;p&gt;随着金融市场信息源不断扩展，算法交易面对的数据已经从单一价格序列扩展为行情、成交、新闻、社交媒体、订单簿、资金流和投资者行为共同组成的金融大数据流。对交易系统而言，关键问题不再只是预测下一时刻价格涨跌，而是判断价格变化背后的信息来源、传播路径、交易拥挤程度和潜在风险。尤其在 A 股市场中，涨跌停制度、散户参与度、短线资金行为和社交平台热度会放大情绪传播，形成“利好扩散–追涨聚集–封单松动–恐慌杀跌”的复杂链条。若交易系统只观察价格动量，就可能在上涨后段继续加仓；若只观察新闻情绪，又可能被短期叙事牵引而忽视盘口流动性。&lt;/p&gt;
&lt;p&gt;已有量化交易框架如 FinRL、FinRL-Meta 和 TradeMaster 将交易任务抽象为环境、状态、动作、奖励与回测评估，为深度强化学习和自动化策略比较提供了标准化研究基础。同时，金融大语言模型和多 Agent 技术使交易系统能够理解文本新闻、整合外部信息、记录记忆并生成自然语言解释。然而，面向可解释金融智能体研究，仍然存在三个不足：第一，端到端交易模型往往难以说明交易信号来自新闻、技术指标、社交热度还是风险控制；第二，普通历史回测很难低成本复现封单失败、传闻扩散、社交恐慌等极端情绪情景；第三，Agent 的运行日志不一定能沉淀为下一轮可检索、可验证的经验准则。&lt;/p&gt;
&lt;p&gt;本文围绕 Hermes-EM 系统展开研究，将多 Agent 情绪传播市场与 Hermes Quant Agent 统一到同一仿真环境中。本文的核心论点是：在可控市场中同时模拟新闻冲击、社交传播、订单行为、价格反馈和交易者复盘，有助于算法交易 Agent 在动态情景中区分趋势延续、情绪过热和流动性风险。由此，金融大数据不再仅作为输入变量集合，算法交易也不再仅表现为买卖动作输出，而是形成“认知–传播–交易–反馈–进化”的闭环过程。&lt;/p&gt;
&lt;p&gt;本文主要工作包括四点。第一，设计面向 A 股市场的多 Agent 情绪仿真环境，将新闻事件、社交传播、订单簿撮合和异质投资者行为放入同一动态系统。第二，构建情绪市场与交易 Agent 的协同建模框架，使新闻冲击、社交扩散、盘口变化和交易反馈能够在同一环境中被观察和追踪。第三，提出风险优先的多 Agent 交易决策链，使 Hermes Agent 在生成 Buy/Sell/Hold 前经过市场感知、指标分析、新闻情绪、风险闸门、回测证据和经验记忆等环节。第四，通过“涨停失败/主力诱多”仿真数据展示系统如何识别社交过热、传闻扩散和流动性收缩，并比较动量基线与 Hermes 情绪感知策略的表现。&lt;/p&gt;
&lt;h1&gt;2 相关工作&lt;/h1&gt;
&lt;h2&gt;2.1 金融大数据与投资者情绪&lt;/h2&gt;
&lt;p&gt;行为金融研究表明，噪声交易、过度反应、信息瀑布和从众行为会影响资产价格，投资者情绪并非只是一种心理描述，而可以通过新闻文本、媒体语调、搜索行为、交易活跃度和社交表达间接观测。在 A 股市场中，涨跌停制度和高换手率会进一步放大短线注意力：当价格接近涨停时，社交热度、封单强度和资金流向会共同影响投资者对后续走势的判断。因此，金融大数据分析需要同时处理结构化行情数据和非结构化文本、社交互动与订单簿信号。&lt;/p&gt;
&lt;h2&gt;2.2 多智能体金融市场仿真&lt;/h2&gt;
&lt;p&gt;人工股票市场和多智能体金融建模强调，市场价格可以看作异质主体在信息、偏好和约束下交互形成的结果。与静态数据集相比，多 Agent 仿真能够构造可控场景，并观察不同角色在新闻冲击、社交传播和订单簿撮合中的行为差异。在此基础上，Hermes-EM 将散户学习者、游资、公募、北向资金、稳定资金、普通量化和训练型 Hermes Agent 放入同一个 A 股式仿真市场中，使市场状态由新闻、社交传播、异质订单和价格反馈共同生成。&lt;/p&gt;
&lt;h2&gt;2.3 算法交易与金融 Agent&lt;/h2&gt;
&lt;p&gt;算法交易从早期技术指标和统计套利，发展到机器学习预测、强化学习和多任务交易平台。FinRL 系列框架降低了金融强化学习的实验门槛，TradeMaster 则进一步强调多任务、多数据集和标准化评估。近年来，LLM Agent 在金融场景中被用于新闻理解、策略解释、信息整合和记忆反思。但金融 Agent 若要进入交易决策环节，仍需要风险约束、回测证据、仓位控制和可审计决策链。本文的 Hermes Agent 采用多 Agent 分工与风险优先机制，结合 LLM 的解释能力与量化风控机制。&lt;/p&gt;
&lt;h2&gt;2.4 可解释金融 Agent 与经验记忆&lt;/h2&gt;
&lt;p&gt;可解释金融 Agent 的核心挑战在于将多源信号转化为可审计的交易理由。仅依赖端到端模型可能得到较高回测收益，却难以说明一次买卖动作是由价格趋势、新闻叙事、社交热度还是风险约束驱动。FinAgent 和 FinMem 等研究已经引入反思与记忆机制，使 Agent 能够利用历史经验调整后续判断。本文沿着这一思路，将交易后的收益、回撤、风险暴露和错误归因压缩为策略级经验，并将经验记忆纳入下一轮交易决策，使仿真市场中的实验结果能够影响后续行为。&lt;/p&gt;
&lt;h1&gt;3 基础与定义&lt;/h1&gt;
&lt;h2&gt;3.1 多 Agent 仿真市场基本要素&lt;/h2&gt;
&lt;p&gt;本文将多 Agent 情绪市场表示为
$$
\mathcal{M}_t=(\mathcal{A}_t,\mathcal{I}_t,\mathcal{O}_t,\mathcal{S}_t,\mathcal{R}),
$$
其中 $\mathcal{A}_t$ 表示市场参与者集合，$\mathcal{I}_t$ 表示新闻、帖子和传闻等信息集合，$\mathcal{O}_t$ 表示订单与成交记录，$\mathcal{S}_t$ 表示价格、成交量、情绪、拥挤度和流动性等市场状态，$\mathcal{R}$ 表示交易制度和角色行为规则。该表示不追求复刻真实市场中的每个主体，而是用可控的异质行为刻画情绪传播、交易拥挤和价格反馈之间的关系。&lt;/p&gt;
&lt;p&gt;具体而言，信息事件包括订单利好、封单不足传闻和游资撤退等外部冲击，它们会改变市场主体的信息暴露和情绪判断；市场主体包括散户、游资、公募、量化研究员和 Hermes Agent，不同主体依据各自风险偏好、信息来源和交易约束生成委托、撤单、成交与持仓变化；社交传播则通过看多帖、风险提醒、传闻帖和分析帖的点赞、收藏、转发与推荐曝光放大或反转市场情绪。上述过程共同影响价格、成交量、盘口深度、拥挤度和流动性，并进一步形成可被交易 Agent 读取的市场状态。交易结束后，收益、回撤、风险暴露和失败归因会被压缩为经验记忆，在验证通过后影响后续相似情景中的决策。&lt;/p&gt;
&lt;h2&gt;3.2 动态市场状态&lt;/h2&gt;
&lt;p&gt;在仿真市场中，一个 tick 的市场状态可写为
$$
E_t=(P_t,V_t,S_t,H_t,L_t,Q_t,N_t),
$$
其中 $P_t$ 为价格，$V_t$ 为成交量，$S_t$ 为市场情绪，$H_t$ 为从众或拥挤度，$L_t$ 为流动性，$Q_t$ 为订单簿状态，$N_t$ 为新闻和社交信息集合。市场状态更新由新闻冲击、Agent 订单、社交传播和规则约束共同决定：
$$
E_{t+1}=\Phi(E_t,N_t,O_t,A_t)+\epsilon_t,
$$
其中 $O_t$ 表示 tick $t$ 的订单集合，$A_t$ 表示 Agent 群体的行为状态，$\epsilon_t$ 表示随机扰动。该定义强调新闻不会直接决定价格，而是通过投资者认知、社交传播和订单簿反馈逐步传导。&lt;/p&gt;
&lt;h2&gt;3.3 风险优先交易决策&lt;/h2&gt;
&lt;p&gt;Hermes Agent 的交易动作集合记为 $\mathcal{D}={\mathrm{Buy},\mathrm{Sell},\mathrm{Hold},\mathrm{RiskOff}}$。在每一轮决策中，系统先计算策略、市场状态、风险、回测、指标、新闻和记忆等分项评分，再经风险闸门修正。综合评分可写为
$$
D_t=0.30S_{\mathrm{strategy}}+0.18S_{\mathrm{regime}}+0.18(100-R_{\mathrm{risk}})
+0.10S_{\mathrm{backtest}}+0.10S_{\mathrm{indicator}}+0.09S_{\mathrm{news}}+0.05S_{\mathrm{memory}}.
$$
若风险分数 $R_{\mathrm{risk}}$ 过高，即使策略评分较高，系统也会降低仓位或输出 RiskOff。该机制使交易动作不由单一信号决定，而由市场状态、情绪传播、风险约束和经验记忆共同决定。&lt;/p&gt;
&lt;h1&gt;4 应用模型及方法&lt;/h1&gt;
&lt;h2&gt;4.1 系统总体架构&lt;/h2&gt;
&lt;p&gt;Hermes-EM 的总体设计可以概括为“多 Agent 情绪市场 + 风险感知交易 Agent + 经验自进化机制”。这一框架服务于三个相互衔接的研究任务：多 Agent 情绪市场用于生成可控且可追踪的市场情景，风险感知交易 Agent 用于在行情、情绪、盘口和历史经验之间形成交易判断，经验自进化机制则将交易结果和失败归因转化为后续可复用的行为准则。三者共同解决一个核心问题：如何将非结构化情绪信息、结构化行情信号和交易经验转化为可解释、可复盘的算法交易过程。&lt;/p&gt;
&lt;p&gt;图 1 展示 Hermes-EM 的整体市场仿真闭环。外部新闻、投资者认知、社交传播、订单形成和价格反馈并非彼此独立，而是在同一市场环境中相互触发，并为交易 Agent 提供可观察的风险场景。&lt;/p&gt;
&lt;p&gt;图中上方对应外部信息进入市场后的认知更新路径，中部对应信息传播与订单行为之间的交易闭环，下方给出规则约束、异质主体、传播可追踪和路径推演四类实验条件。该结构使价格反转能够被分解为新闻冲击、情绪扩散、订单变化和策略反馈组成的证据链，而非仅归因于价格波动本身。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:market_arch&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/market_design_architecture.png&quot; style=&quot;width:94.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;A 股情绪传播仿真市场架构。新闻、社交传播、订单行为、价格反馈和策略学习共同构成可观测的市场测试环境。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图 2 进一步给出 Hermes Quant Agent 的内部决策链。交易动作并非由单一价格信号直接产生，而是在数据接入、指标分析、新闻情绪、风险控制、回测证据和策略记忆共同约束后生成。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:agent_arch&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/hermes_quant_agent_architecture.png&quot; style=&quot;width:82.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes Quant Agent 架构。系统从数据接入、指标分析、新闻情绪、风险控制、回测证据和策略记忆中生成可解释交易决策。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;4.2 金融大数据层：情绪市场与传播链&lt;/h2&gt;
&lt;p&gt;金融大数据层的任务是将真实市场中难以直接控制的情绪传播过程转化为可观察、可复现实验环境。系统设置散户学习者、游资、公募基金、北向资金、稳定资金、普通量化和 Hermes Agent 等角色。不同角色拥有不同信息源、风险偏好和行为约束：散户更容易受推荐流和传闻影响，游资关注涨停接力和撤退阈值，机构更重视估值与组合约束，Hermes Agent 则将这些行为作为训练环境中的可观测信号。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:dynamic_market&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/dynamic_agent_market.png&quot; style=&quot;width:96.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;动态多 Agent 市场环境。外部新闻经由异质 Agent 的认知更新、社交互动和订单簿反馈形成多条可能市场路径。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;4.3 信息传播与交易证据融合&lt;/h2&gt;
&lt;p&gt;信息传播层连接金融大数据与算法交易。其处理过程包括四步：第一，从新闻事件和社交帖子中刻画事件类型、情绪方向、强度、可信度和时间衰减；第二，记录帖子传播、点赞、收藏、转发和关注关系，以刻画社交热度扩散过程；第三，记录每个 Agent 的观察、决策、委托、成交和收益，以形成可复查的行为轨迹；第四，将市场状态、策略结果和复盘结论写入经验记忆。由此，卖出决策可被追溯至一组明确证据：tick 52 出现封单不足传闻，风险帖子热度上升，游资净流出，盘口流动性下降，且历史经验提示高拥挤、低流动性场景应降低仓位。&lt;/p&gt;
&lt;h2&gt;4.4 算法交易层：多 Agent 决策链&lt;/h2&gt;
&lt;p&gt;算法交易层由 Hermes Quant Agent 完成。该层并非由单一模型直接输出买卖信号，而是将交易任务拆分为多个专业环节：市场感知 Agent 读取行情、成交量和订单簿；指标分析 Agent 计算 RSI、MACD、动量和波动率；新闻情绪 Agent 读取事件与社交传播记录；策略 Agent 生成候选交易动作；风险 Agent 检查回撤、仓位和拥挤风险；回测 Agent 提供历史表现证据；反思 Agent 将本轮结果压缩为经验记忆。&lt;/p&gt;
&lt;p&gt;该设计使算法交易结果具有可审计性。若系统给出“减仓”而不是“继续追涨”，研究者可以回溯到具体市场证据：社交热度是否过快上升，传闻是否出现，游资是否撤退，订单簿买盘深度是否下降，历史经验中是否存在相似失败案例。该回溯能力使 Hermes Agent 的交易建议不再是孤立信号，而是由市场状态、主体行为和风险约束共同支撑的可解释结果。&lt;/p&gt;
&lt;h2&gt;4.5 经验自进化机制&lt;/h2&gt;
&lt;p&gt;Hermes-EM 中的经验自进化机制采用“记录–评价–归因–候选经验–验证–保留”的闭环。系统并不将一次交易日志直接视为新规则，而是先评估收益、回撤和解释一致性，再分析导致成功或失败的市场条件，最后在独立验证场景中检验候选经验是否稳定有效。只有当候选经验能够同时改善风险收益表现和决策可解释性时，经验才会进入下一轮行为准则。对市场角色而言，该机制可避免散户、游资、机构和量化角色因单次噪声反馈而偏离原有画像；对 Hermes Agent 而言，该机制可将“高社交热度 + 低流动性 + 游资撤退”这类失败模式压缩为可复用风险纪律。经验更新机制的文献依据见附录。&lt;/p&gt;
&lt;h1&gt;5 实验分析&lt;/h1&gt;
&lt;h2&gt;5.1 实验数据&lt;/h2&gt;
&lt;p&gt;实验采用 Hermes-EM 生成的仿真市场数据，而非真实交易数据。场景命名为“涨停失败/主力诱多”，共包含 0–90 个 tick。原始记录由 tick 级行情与情绪、事件日志、社交传播链、Agent 关键决策、阶段统计和策略财富曲线六类数据组成。主要字段包括价格、成交量、市场情绪、散户情绪、游资情绪、盘口不平衡、拥挤度、新闻冲击、买卖主动比例、流动性、波动率、社交热度、传闻热度、资金净流、Hermes 动作和动作理由。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;tick 区间&lt;/th&gt;
&lt;th&gt;均价&lt;/th&gt;
&lt;th&gt;最高价&lt;/th&gt;
&lt;th&gt;平均情绪&lt;/th&gt;
&lt;th&gt;平均拥挤度&lt;/th&gt;
&lt;th&gt;平均流动性&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;稳定吸筹&lt;/td&gt;
&lt;td&gt;0–20&lt;/td&gt;
&lt;td&gt;10.00&lt;/td&gt;
&lt;td&gt;10.03&lt;/td&gt;
&lt;td&gt;0.002&lt;/td&gt;
&lt;td&gt;0.097&lt;/td&gt;
&lt;td&gt;0.722&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;利好铺垫&lt;/td&gt;
&lt;td&gt;21–34&lt;/td&gt;
&lt;td&gt;10.26&lt;/td&gt;
&lt;td&gt;10.48&lt;/td&gt;
&lt;td&gt;0.278&lt;/td&gt;
&lt;td&gt;0.310&lt;/td&gt;
&lt;td&gt;0.797&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;拉升追涨&lt;/td&gt;
&lt;td&gt;35–48&lt;/td&gt;
&lt;td&gt;10.71&lt;/td&gt;
&lt;td&gt;10.92&lt;/td&gt;
&lt;td&gt;0.656&lt;/td&gt;
&lt;td&gt;0.632&lt;/td&gt;
&lt;td&gt;0.782&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;封单松动&lt;/td&gt;
&lt;td&gt;49–60&lt;/td&gt;
&lt;td&gt;10.51&lt;/td&gt;
&lt;td&gt;10.87&lt;/td&gt;
&lt;td&gt;0.251&lt;/td&gt;
&lt;td&gt;0.678&lt;/td&gt;
&lt;td&gt;0.579&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;恐慌杀跌&lt;/td&gt;
&lt;td&gt;61–72&lt;/td&gt;
&lt;td&gt;9.76&lt;/td&gt;
&lt;td&gt;10.03&lt;/td&gt;
&lt;td&gt;-0.503&lt;/td&gt;
&lt;td&gt;0.759&lt;/td&gt;
&lt;td&gt;0.361&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;护盘修复&lt;/td&gt;
&lt;td&gt;73–90&lt;/td&gt;
&lt;td&gt;9.69&lt;/td&gt;
&lt;td&gt;9.88&lt;/td&gt;
&lt;td&gt;-0.362&lt;/td&gt;
&lt;td&gt;0.572&lt;/td&gt;
&lt;td&gt;0.488&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;涨停失败场景的阶段统计&lt;/p&gt;
&lt;h2&gt;5.2 评价指标及基准模型&lt;/h2&gt;
&lt;p&gt;本文实验以方法验证为目标，不将仿真收益外推为真实市场收益。评价指标包括四类：第一，传播可解释性，即能否从事件日志和社交传播链追踪情绪变化来源；第二，微观结构识别能力，即能否在价格大幅下跌前观察到盘口不平衡、流动性收缩和拥挤度上升；第三，策略表现，包括最终收益率和最大回撤；第四，经验沉淀能力，即系统能否把交易结果压缩为后续可检索的经验摘要。&lt;/p&gt;
&lt;p&gt;对照基准为追涨动量策略。该策略在价格拉升阶段买入，在恐慌下跌后被动退出，主要依据价格动量作出动作。Hermes 情绪感知策略则同时读取新闻、社交热度、传闻强度、拥挤度、盘口流动性和 Agent 行为，并在社交过热与封单风险出现时主动降低仓位。&lt;/p&gt;
&lt;h2&gt;5.3 实验方法&lt;/h2&gt;
&lt;p&gt;实验事件链如下：tick 22 出现虚拟产业订单利好；tick 36 游资集中买入并发布看多内容，推荐系统放大热度；tick 48 Hermes 观测到社交热度、拥挤度和盘口买盘同时处于高位；tick 52 出现封单不足传闻，风险帖子热度超过看多帖；tick 56 游资撤单并集中卖出；tick 64 买盘深度快速下降，价差扩大，恐慌情绪沿社交边传播；tick 74 稳定资金入场，盘口买盘深度修复。&lt;/p&gt;
&lt;p&gt;在此过程中，仿真日志持续记录三类证据：一是事件及其情绪冲击，二是帖子传播和社交热度变化，三是 Agent 订单、资金流和市场状态变化。Hermes Agent 的动作也被同步记录，例如 tick 24 小仓位试探买入，tick 45 在社交热度与盘口买盘同时过热时降低追涨暴露，tick 52 在封单不足传闻扩散且游资净流出时退出高位仓位，tick 74 在护盘资金入场且卖压衰减时分批低吸。&lt;/p&gt;
&lt;h2&gt;5.4 实验结果与分析&lt;/h2&gt;
&lt;p&gt;首先，价格和情绪曲线说明该场景并非单调利好行情。图 &amp;lt;a href=&quot;#fig:price_sentiment&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:price_sentiment&quot;&amp;gt;4&amp;lt;/a&amp;gt; 显示，价格先在利好和游资推动下从 10 元附近上升至 10.9 元附近，随后在传闻和流动性冲击下快速回落。市场情绪也经历了由中性到乐观、再由乐观转为恐慌的过程。该结果说明情绪传播链能够生成比普通历史回测更丰富的训练情景。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:price_sentiment&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/price_sentiment.png&quot; style=&quot;width:88.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;价格与市场情绪变化。价格先被利好和游资行为推高，随后在传闻扩散与流动性冲击下快速下行。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;其次，社交传播和微观结构信号提供了价格反转前的风险证据。传闻出现后，风险帖子快速获得点赞、收藏和转发，社交热度没有立即下降，反而从看多扩散转向恐慌扩散；与此同时，在封单松动后，拥挤度仍处于高位，但流动性明显下降，形成“高拥挤、低流动性”的危险组合。该组合正是 Hermes Agent 降低仓位的主要证据。相关传播曲线与盘口信号见附录“补充实验结果”。&lt;/p&gt;
&lt;p&gt;这一结果也说明，多 Agent 情绪市场的价值不仅在于生成价格路径，还在于同时保留价格路径背后的传播证据和交易证据。对于算法交易 Agent 而言，这类证据可以帮助区分正常回调、情绪退潮和流动性坍缩三种不同风险来源。&lt;/p&gt;
&lt;p&gt;最后，策略对比结果表明情绪市场仿真能够改善风险暴露时点。追涨动量基线在上涨后段继续跟随价格，最终财富为 949000 元，收益率为 -5.10%，最大回撤为 6.72%。Hermes 情绪感知策略在 tick 45 降低追涨暴露，在 tick 52 退出高位仓位，并在护盘修复阶段分批低吸，最终财富为 1016640 元，收益率为 1.66%，最大回撤为 0.28%。两者差异并不只来自最终收益，而来自决策证据的不同：动量策略只能看到价格仍在高位，Hermes Agent 还能看到传闻扩散、社交恐慌、游资撤退、流动性下降和历史经验中的相似风险模式。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:strategy&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/strategy_comparison.png&quot; style=&quot;width:86.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes 情绪感知策略与追涨动量基线的财富曲线对比。Hermes 在社交过热和传闻扩散阶段降低仓位，从而避开主要下跌段。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;策略&lt;/th&gt;
&lt;th&gt;最终财富/元&lt;/th&gt;
&lt;th&gt;收益率&lt;/th&gt;
&lt;th&gt;最大回撤&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;追涨动量基线&lt;/td&gt;
&lt;td&gt;949000&lt;/td&gt;
&lt;td&gt;-5.10%&lt;/td&gt;
&lt;td&gt;6.72%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Hermes 情绪感知策略&lt;/td&gt;
&lt;td&gt;1016640&lt;/td&gt;
&lt;td&gt;1.66%&lt;/td&gt;
&lt;td&gt;0.28%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;策略对比结果&lt;/p&gt;
&lt;p&gt;此外，实验记录了经验沉淀过程。系统将多轮运行后的单次交易记录压缩为策略级经验摘要，并在下一轮面对相似市场状态时检索使用。例如，“社交热度与传闻热度同时上升且盘口流动性下降时，应降低追涨仓位”由 tick 45–64 的风险链条提供支持。该类经验由交易结果、风险指标和验证门控共同筛选形成，相关可视化记录和补充证据见附录。&lt;/p&gt;
&lt;h1&gt;6 总结与展望&lt;/h1&gt;
&lt;p&gt;本文围绕 Hermes-EM 构建了融合金融大数据、多 Agent 情绪市场和算法交易 Agent 的方法框架。情绪市场生成新闻、社交传播、订单簿和异质主体行为；交易 Agent 读取市场状态、情绪传播、风险约束和历史经验，在风险约束下给出可解释交易动作，并将交易结果反向沉淀为经验准则。&lt;/p&gt;
&lt;p&gt;实验分析表明，在“涨停失败/主力诱多”场景中，仅基于价格动量难以及时识别上涨后段的拥挤风险，而 Hermes Agent 可以结合社交热度、传闻扩散、盘口流动性、游资撤退和历史经验提前降低风险暴露。进一步研究可结合真实新闻、公告、研报和盘口数据，并引入更严格的回测协议、交易成本建模和跨场景经验验证。&lt;/p&gt;
&lt;p&gt;99 De Long, J. B., Shleifer, A., Summers, L. H., and Waldmann, R. J. Noise trader risk in financial markets. &lt;em&gt;Journal of Political Economy&lt;/em&gt;, 1990.&lt;/p&gt;
&lt;p&gt;Bikhchandani, S., Hirshleifer, D., and Welch, I. A theory of fads, fashion, custom, and cultural change as informational cascades. &lt;em&gt;Journal of Political Economy&lt;/em&gt;, 1992.&lt;/p&gt;
&lt;p&gt;Tetlock, P. C. Giving content to investor sentiment: The role of media in the stock market. &lt;em&gt;Journal of Finance&lt;/em&gt;, 2007.&lt;/p&gt;
&lt;p&gt;Loughran, T., and McDonald, B. When is a liability not a liability? Textual analysis, dictionaries, and 10-Ks. &lt;em&gt;Journal of Finance&lt;/em&gt;, 2011.&lt;/p&gt;
&lt;p&gt;Lux, T., and Marchesi, M. Scaling and criticality in a stochastic multi-agent model of a financial market. &lt;em&gt;Nature&lt;/em&gt;, 1999.&lt;/p&gt;
&lt;p&gt;LeBaron, B., Arthur, W. B., and Palmer, R. Time series properties of an artificial stock market. &lt;em&gt;Journal of Economic Dynamics and Control&lt;/em&gt;, 1999.&lt;/p&gt;
&lt;p&gt;Farmer, J. D., and Foley, D. The economy needs agent-based modelling. &lt;em&gt;Nature&lt;/em&gt;, 2009.&lt;/p&gt;
&lt;p&gt;Liu, X.-Y., et al. FinRL: Deep reinforcement learning framework to automate trading in quantitative finance. 2021.&lt;/p&gt;
&lt;p&gt;Liu, X.-Y., et al. FinRL-Meta: Market environments and benchmarks for data-driven financial reinforcement learning. 2022.&lt;/p&gt;
&lt;p&gt;Sun, S., et al. TradeMaster: A holistic quantitative trading platform empowered by reinforcement learning. 2023.&lt;/p&gt;
&lt;p&gt;Yang, H., et al. FinGPT: Open-source financial large language models. 2023.&lt;/p&gt;
&lt;p&gt;Yang, H., et al. FinRobot: An open-source AI agent platform for financial applications. 2024.&lt;/p&gt;
&lt;p&gt;Zhang, W., et al. FinAgent: A multimodal foundation agent for financial trading. 2024.&lt;/p&gt;
&lt;p&gt;Yu, Y., et al. FinMem: A performance-enhanced LLM trading agent with layered memory and character design. 2025.&lt;/p&gt;
&lt;p&gt;Huang, Z., Xu, J., Yang, Y., Gong, Z., Yang, Q., Tian, M., Wang, X., Lv, C., Gao, X., Dai, Q., Liu, B., Qiu, K., Yang, X., Chen, D., Zheng, X., and Luo, C. From raw experience to skill consumption: A systematic study of model-generated agent skills. &lt;em&gt;arXiv preprint arXiv:2605.23899&lt;/em&gt;, 2026.&lt;/p&gt;
&lt;p&gt;Yang, Y., Gong, Z., Huang, W., Yang, Q., Zhou, Z., Huang, Z., Li, Y., Gao, X., Dai, Q., Liu, B., et al. SkillOpt: Executive strategy for self-evolving agent skills. &lt;em&gt;arXiv preprint arXiv:2605.23904&lt;/em&gt;, 2026.&lt;/p&gt;
&lt;p&gt;alchaincyf. Darwin-skill: Autoresearch-inspired autonomous skill optimization for Claude Code. GitHub repository, 2026. &lt;a href=&quot;https://github.com/alchaincyf/darwin-skill&quot;&gt;https://github.com/alchaincyf/darwin-skill&lt;/a&gt;.&lt;/p&gt;
&lt;h1&gt;附录&lt;/h1&gt;
&lt;h2&gt;补充实验结果&lt;/h2&gt;
&lt;p&gt;本节补充展示正文实验分析中未展开的传播链、微观结构和经验沉淀结果。这些材料主要说明“社交过热–传闻扩散–流动性下降–风险降仓”这一证据链，不额外引入新的实验结论。&lt;/p&gt;
&lt;p&gt;图 A1 展示情绪传播由“看多扩散”转向“风险扩散”的过程。传闻热度上升后，社交热度并未立即降温，而是在推荐机制作用下继续放大，进而推动恐慌情绪扩散。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:social_spread&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/social_spread.png&quot; style=&quot;width:88.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;社交热度、传闻热度与拥挤度变化。风险帖子被推荐系统放大后，情绪由乐观追涨切换为恐慌传播。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图 A2 补充说明盘口层面的风险信号。封单松动后，买卖盘不平衡快速转弱，而拥挤度仍处于高位，表明大量资金仍暴露在流动性下降的环境中，该信号构成 Hermes Agent 主动降仓的重要依据。&lt;/p&gt;
&lt;p&gt;三条曲线分别对应不同风险维度：拥挤度反映追涨仓位集中程度，流动性反映仓位退出条件，盘口不平衡反映买卖力量变化。当拥挤度未明显下降而流动性先行转弱时，交易拥挤可能进一步放大价格下行压力。&lt;/p&gt;
&lt;p&gt;结合正文策略财富曲线可见，Hermes Agent 在高位降低仓位并非由价格下跌本身触发，而是由流动性、盘口和拥挤度共同提供的前置风险信号触发。该结果支持本文关于“交易动作应由多源风险证据共同约束”的设计原则。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:microstructure&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/microstructure_signals.png&quot; style=&quot;width:88.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;盘口不平衡、流动性和拥挤度变化。封单松动后买盘深度下降，拥挤交易暴露出更高下行风险。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图 A3 展示交易复盘向经验记忆转化的过程。系统将收益、风险和失败归因压缩为可检索经验，使下一轮相似场景中的交易动作受到历史风险纪律约束。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:experience&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/agent_experience_module.png&quot; style=&quot;width:90.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes Agent 经验学习模块。系统将多轮交易结果压缩为策略级经验摘要，并展示运行档案、收益、风险和经验结论。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;仿真过程可视化记录&lt;/h2&gt;
&lt;p&gt;本节给出 Hermes-EM 的可视化记录，用于补充说明仿真市场状态和 Agent 行为轨迹的观测方式。这些记录主要说明实验过程如何被观察和回溯，不额外引入新的实验结论。&lt;/p&gt;
&lt;p&gt;图 A4 给出多 Agent 市场沙盘的整体状态记录。该图表明，仿真市场并非单一价格序列，而是由不同角色、市场场景和交易状态共同构成的动态实验空间。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:app_market_sandbox&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/frontend_market_sandbox_method.png&quot; style=&quot;width:95.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;多 Agent 市场沙盘记录。不同市场角色被放置在同一仿真空间中，使主体行为、市场场景和交易状态可以相互对应。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图 A5 展示单个 Agent 或 Agent 群体的行为记录。资产、持仓、收益、观察、决策、委托和反馈被组织在同一记录框架中，用于追踪一次交易动作从观察到执行再到结果反馈的完整链条。&lt;/p&gt;
&lt;p&gt;该材料将“市场角色”从抽象设定转化为可检查的行为记录。通过比较不同主体在同一事件冲击下的仓位变化、交易动作和收益反馈，可以区分单一主体异常行为与多主体同向共振对市场波动的影响。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:app_agent_cards&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/frontend_agent_cards_method.png&quot; style=&quot;width:90.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Agent 群体卡片与动作流程记录。图中展示资产、持仓、收益、观察、决策、委托和反馈，为仿真市场行为轨迹提供可观察记录。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;经验更新机制的文献依据&lt;/h2&gt;
&lt;p&gt;Hermes-EM 的经验自进化模块使用了 Darwin-skill 与 SkillOpt/SkillLens 的方法思想。Darwin-skill 强调“评估–改进–验证–保留或回滚”的棘轮式优化过程，只在候选经验带来可测量改进时更新基线。SkillOpt 将自然语言技能视为冻结 Agent 的外部可训练状态，通过轨迹采样、反思、受限编辑和验证门控生成可部署的经验规则；SkillLens 则从经验生成、技能抽取和技能消费三个阶段系统研究模型生成技能的有效性，为本文的经验抽取与复用提供了方法论依据。在本文中，这些方法被转化为交易场景下的经验筛选机制：只有经过收益、回撤、风险暴露和解释一致性验证的交易经验，才会进入 Hermes Agent 的后续决策准则。&lt;/p&gt;
&lt;p&gt;图 A6 从流程验证和性能保留两个角度说明经验更新机制。上图展示候选经验的评估、改进、验证和确认流程；下图展示仅保留有效改进、回滚退化候选的棘轮机制，以避免噪声样本破坏稳定决策基线。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:app_darwin&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/darwin_skill_core_loop.png&quot; style=&quot;width:90.0%&quot; /&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/darwin_skill_ratchet_mechanism.png&quot; style=&quot;width:90.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Darwin-skill 式经验保留机制。上图展示评估、改进、验证和确认流程；下图展示只保留有效改进、退化候选自动回滚的棘轮逻辑。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图 A7 进一步说明文本形式经验规则的优化过程。交易轨迹首先形成反馈，再经过反思和受限编辑生成候选规则，最后由验证门控决定是否进入后续决策准则。&lt;/p&gt;
&lt;p&gt;与图 A6 侧重经验保留机制不同，图 A7 侧重经验规则的文本化表达。在交易场景中，复盘结果不仅包含盈亏数字，还需要提炼为可被下一轮检索的条件化表述，例如“社交热度持续上升但盘口流动性转弱时，应降低追涨仓位”。这类文本经验经过验证后，可由复盘记录转化为策略约束。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:app_skillopt&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-knowledge-graph-report/skillopt_training_loop.png&quot; style=&quot;width:94.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;SkillOpt 式文本空间训练循环。该方法将经验规则视为可优化文本对象，通过轨迹反馈、反思编辑和验证门控形成可复用技能。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图 A7 对应到本文实验时，失败轨迹不会被直接写入交易策略，而是先形成候选经验，再通过验证门控判断是否保留。如果候选经验只能解释一次偶然波动，系统仍保留原有规则；只有当它能够稳定降低回撤或改善决策一致性时，才会成为下一轮可检索的经验。&lt;/p&gt;
&lt;p&gt;在“涨停失败/主力诱多”场景中，经验更新主要提取 tick 45–64 之间的风险条件，包括社交热度继续上升、封单不足传闻扩散、游资净流出和盘口流动性下降。经过验证后，这些条件被整理为风险提醒，帮助 Hermes Agent 在相似场景中优先降低高位追涨暴露。&lt;/p&gt;
&lt;p&gt;附录材料主要补充两类证据：一类是市场状态和 Agent 行为轨迹，另一类是经验规则生成与验证流程。二者共同说明，Hermes-EM 可以在同一仿真链条中观察情绪传播、交易拥挤和经验更新过程；相关结论主要对应本文设置的仿真场景。&lt;/p&gt;
</content:encoded></item><item><title>关于转生成为传奇交易员这件事</title><link>https://www.whalefall.top/posts/hermes-quant-agent-algorithmic-trading/</link><guid isPermaLink="true">https://www.whalefall.top/posts/hermes-quant-agent-algorithmic-trading/</guid><description>面向仿真情绪市场的 Hermes Quant Agent：从多 Agent 协同、风险修正到经验学习与算法交易实验。</description><pubDate>Fri, 31 Jul 2026 00:20:00 GMT</pubDate><content:encoded>&lt;hr /&gt;
&lt;p&gt;&lt;strong&gt;关于转生成为传奇交易员这件事&lt;/strong&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;刘勇杰&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;李家豪&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;闫晨曦&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;西南财经大学&lt;/td&gt;
&lt;td&gt;西南财经大学&lt;/td&gt;
&lt;td&gt;西南财经大学&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Abstract&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;算法交易正在从单一预测模型转向由多源信息、风险约束和自适应决策共同构成的智能交易系统。然而，现有量化交易 Agent 往往存在三类不足：其一，模型容易将价格、新闻、技术指标和风险控制混合在同一黑箱中，难以解释交易决策的形成过程；其二，许多 Agent 主要在历史行情回测中优化，缺少可控的情绪传播与极端市场情景试炼；其三，Agent 的经验积累容易停留在一次性记录层面，难以形成可复用、可验证的行为准则。针对这些问题，本文设计并实现一个面向仿真情绪市场的自进化多 Agent 量化交易者 Hermes Quant Agent（下称 Hermes Agent）。该系统将交易过程抽象为市场感知、专业分析、风险审查、决策解释和经验进化五个功能层，并通过前端可视化展示不同 Agent 的分析结果、证据冲突和修正过程。进一步地，本文将 Hermes Agent 与多 Agent 仿真情绪市场连接，使其在新闻冲击、社交传播、盘口变化和群体情绪反馈构成的沙盒环境中接受训练。实验部分展示系统前端功能、Agent 决策链和经验学习结果。结果表明，该架构能够把交易决策从单一买卖信号扩展为可追踪的认知–传播–交易–反馈闭环，为低成本训练、解释和优化量化 Agent 提供可复用框架。项目代码见 GitHub：&lt;a href=&quot;https://github.com/HanaViolet/Hermes-EM&quot;&gt;&lt;code&gt;HanaViolet/Hermes-EM&lt;/code&gt;&lt;/a&gt;。&lt;/p&gt;
&lt;p&gt;多 Agent；量化交易；仿真情绪市场；可解释决策；经验自优化；金融大数据&lt;/p&gt;
&lt;h1&gt;一、引言&lt;/h1&gt;
&lt;p&gt;随着金融市场数据维度不断扩展，量化交易系统已经不再只是对价格序列进行拟合的预测模型，而逐渐演化为能够同时处理行情、新闻、指标、风险和执行约束的自动化决策系统。传统算法交易通常依赖技术指标、统计套利、机器学习预测或强化学习策略。近年来，FinRL、FinRL-Meta 和 TradeMaster 等框架将交易任务抽象为环境、状态、动作、奖励和回测评估，使深度强化学习能够在标准化交易流程中训练和比较。与此同时，大语言模型和 Agent 技术的发展，使交易系统可以调用工具、理解自然语言新闻、保留记忆并进行多角色协同，从而更接近真实交易员的分析流程。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:intro_multi_agent&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/intro_multi_agent_collaboration.png&quot; style=&quot;width:72.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;多 Agent 协作范式示意。复杂任务可以被拆分给多个具有不同能力的 Agent，并通过协同通信、证据汇聚和结果整合形成最终解决方案。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;然而，面向真实金融市场的量化 Agent 仍然面临重要瓶颈。第一，单 Agent 或端到端模型容易把价格、新闻、风险和回测结果混合到黑箱中，用户难以判断交易建议来自何种证据。第二，历史数据回测只能复现已经发生的行情，较难低成本覆盖新闻冲击、情绪扩散、追涨过热、封单失败、恐慌杀跌等非平稳场景。第三，交易 Agent 即使能够保留运行记录，也不一定能把失败或成功经验转化为下一轮可执行的行为准则。换言之，一个更合理的量化 Agent 既不能只依赖价格和成交量，也不能只追随新闻和社交热度，而应当在识别真实趋势、情绪噪声和流动性冲击的基础上给出风险约束下的可解释决策。&lt;/p&gt;
&lt;p&gt;相关研究已经从不同方向推进了这一问题。机器学习在中国股票市场中的研究说明，市场微观结构、散户参与和交易成本会显著影响预测信号的有效性；风险感知和层次化强化学习工作强调，日内交易和高频交易必须同时优化收益和风险；多专家交易和多 Agent 金融系统进一步表明，交易决策可以由多个专门模型或角色共同形成。不过，这些工作多以历史行情或标准化 benchmark 为主要训练对象，对情绪传播、社交曝光和订单簿反馈之间的闭环刻画仍然有限。StockAgent 和 MarS 等仿真市场研究说明，大模型或生成式 Agent 可以用于构造更复杂的投资者行为和市场环境，为本文将量化交易者放入仿真情绪市场中训练提供了启发。&lt;/p&gt;
&lt;p&gt;本文提出 Hermes Agent，一个面向仿真情绪市场的自进化多 Agent 量化交易框架。系统不把交易任务压缩为单一预测模型，而是将其组织为“市场信息感知–专业 Agent 分析–风险约束审查–可解释交易决策–经验反馈进化”的链式结构。不同 Agent 分别负责行情、技术状态、新闻情绪、策略候选、风险测度、历史经验和决策审查，最终由协同决策机制给出交易动作、置信度、仓位约束和解释理由。该过程通过前端控制室可视化展示，使用户能够观察不同 Agent 如何形成判断、发生冲突并完成修正。&lt;/p&gt;
&lt;p&gt;本文的主要贡献包括四点。第一，构建模块化、可解释的多 Agent 量化决策链，将传统量化交易中混合在同一模型内的数据处理、技术指标、新闻情绪、策略生成、风险控制、回测评估和交易解释拆分为可观察的专业 Agent。第二，引入风险优先的二阶段决策机制，使系统先由评分模型生成初始 Buy/Sell/Hold，再经过投票聚合、批判审查、冲突消解和决策修正，避免交易动作完全由单一模型或单一信号决定。第三，将量化交易 Agent 与仿真情绪市场连接，把新闻冲击、社交传播、盘口变化和群体情绪反馈纳入训练闭环，使 Agent 能在可控沙盒中学习区分真实趋势、情绪过热和流动性风险。第四，借鉴 SkillOpt 的思想，将交易后的收益、风险、回撤和 Agent 责任归因转化为可复用经验，并在验证门控下更新行为准则，从而使 Agent 具备可记录、可压缩、可验证的自优化能力。&lt;/p&gt;
&lt;h1&gt;二、相关工作&lt;/h1&gt;
&lt;h2&gt;（一）强化学习与机器学习量化交易&lt;/h2&gt;
&lt;p&gt;机器学习与深度强化学习已经成为量化交易的重要实现路径。Leippold 等对中国股票市场的机器学习研究表明，市场微观结构、流动性和交易成本会影响机器学习信号的有效性。FinRL 将数据处理、交易环境、深度强化学习算法和回测评估组织为可复现框架，降低了自动化交易研究的工程门槛；FinRL-Meta 进一步强调，交易研究需要统一的数据接口、市场环境和 benchmark，以便比较不同算法在多市场条件下的表现。TradeMaster 则将多任务交易、数据集和强化学习算法集成到统一平台，体现了量化交易研究从单个模型转向系统平台的趋势。&lt;/p&gt;
&lt;p&gt;风险和交易执行也是强化学习交易的重要主题。DeepScalper 面向日内交易场景，强调在捕捉短暂机会时必须考虑风险约束；EarnHFT 针对高频交易提出层次化强化学习框架，说明复杂交易任务往往需要多层决策而非单一策略函数。AlphaMix 等多专家交易工作则通过混合不同交易专家来应对市场状态变化。与这些研究相比，本文不以提出新的强化学习算法为目标，而是把交易系统拆解为可解释 Agent 链条，并进一步把情绪传播与社交反馈纳入训练环境。&lt;/p&gt;
&lt;h2&gt;（二）LLM 与多 Agent 金融决策&lt;/h2&gt;
&lt;p&gt;近年来，金融专用大语言模型为 Agent 化金融决策提供了新的基础能力。BloombergGPT 通过大规模金融语料训练领域模型，说明金融文本、市场数据和通用语料的混合训练可以提升金融任务表现；FinGPT 则从开放金融数据、自动化数据工程和轻量化适配角度，提出更低成本的开源金融 LLM 路径。在此基础上，FinRobot 将金融任务进一步组织为由专业 Agent、金融推理链、模型配置和数据工程组成的平台化工作流，体现了金融 AI 从单模型问答走向可组合工具链的趋势。&lt;/p&gt;
&lt;p&gt;在交易决策层面，FinAgent 将多模态金融信息、工具调用和反思机制结合起来，用于金融交易任务；FinMem 通过分层记忆和角色设计增强 LLM 交易 Agent 对历史信息的吸收能力。TradingAgents 将交易过程组织为多角色协作，使不同 Agent 分别承担分析师、研究员、交易员和风险管理者等职责；FinCon 进一步提出带有概念化语言强化的多 Agent 金融决策系统，通过经理–分析师层级、风险控制和经验信念更新来改善序列投资决策；HedgeAgents 则从多 Agent 风险平衡角度讨论交易系统如何在波动市场中保持稳健。这些研究共同说明，LLM Agent 的价值不只是生成交易文本，而是将信息理解、记忆、讨论、审查和经验更新组织为可执行的决策流程。&lt;/p&gt;
&lt;p&gt;与此同时，金融 Agent 的评估也需要更贴近真实交易任务。InvestorBench 指出，金融决策型 LLM Agent 不应只用一般问答准确率评价，而应结合收益、风险和任务成功率等指标。本文继承多 Agent 金融决策的思想，但对系统边界作出更严格限定：LLM 可以辅助新闻理解、策略建议和自然语言解释，但最终 Buy/Sell/Hold 由可控评分模型、风险闸门和批判修正共同决定。这一设计可以降低单一 LLM 幻觉、过度自信或被短期叙事牵引的风险。&lt;/p&gt;
&lt;h2&gt;（三）仿真市场与情绪传播&lt;/h2&gt;
&lt;p&gt;真实金融市场中的价格变化不仅来自基本面，也来自新闻冲击、社交传播、群体情绪和流动性反馈。StockAgent 通过 LLM Agent 构造模拟投资者和股票市场环境，展示了大语言模型在市场行为仿真中的潜力。MarS 则进一步提出由生成式基础模型驱动的金融市场仿真引擎，用于刻画 Agent、订单和市场反馈之间的关系。这些工作说明，仿真市场可以为交易 Agent 提供历史回测之外的可控训练环境。&lt;/p&gt;
&lt;p&gt;本文的“仿真情绪市场”与上述研究的目标一致，但更强调课程项目中的 A 股情境和情绪传播链条。该市场将外部新闻事件、投资者认知、社交传播、A 股交易规则和策略学习层放入同一闭环。新闻不直接决定价格，而是先改变异质 Agent 的信念、情绪和风险偏好，再通过关注网络、热榜推荐、买卖订单和订单簿反馈影响市场状态。这样的设计使 Hermes Agent 可以在低成本沙盒中反复经历平稳吸筹、利好拉升、追涨过热、封单松动、谣言扩散、恐慌杀跌和护盘修复等场景。&lt;/p&gt;
&lt;h2&gt;（四）Agent 经验积累与行为准则自优化&lt;/h2&gt;
&lt;p&gt;交易 Agent 若只能输出一次性决策，就难以在复杂市场中持续进步。FinAgent 和 FinMem 已经引入反思与记忆机制，使 Agent 能够利用历史经验调整后续判断。SkillOpt 进一步把 Agent 的外部化技能文档视为可训练状态，而不是一次性人工提示：系统先收集带评分的 rollout 轨迹，再通过小批量反思生成候选技能编辑，并用受限文本更新、held-out validation gate 和慢速元更新来决定是否接受新技能。这一思想适合量化交易场景，因为交易结果通常可以用收益、夏普比率、最大回撤、风险分数和胜率等指标进行评价。&lt;/p&gt;
&lt;p&gt;本文借鉴 SkillOpt 的自优化路径，将每轮交易的收益、夏普比率、最大回撤、风险分数、多 Agent 一致性和错误归因转化为策略级经验摘要。当同一类策略积累足够多的成功与失败样本后，系统对经验进行窗口式压缩，并在验证门控通过后更新后续行为准则。与普通运行记录不同，这种经验具有明确的行为指向，例如“风险分数超过阈值时降低仓位”“低胜率策略需要更严格止损”“多 Agent 一致但结果负面时必须重新检查风险纪律”。因此，Hermes Agent 的自优化不是一次性提示词调整，而是一个可记录、可拒绝、可验证的行为准则更新过程。&lt;/p&gt;
&lt;h1&gt;三、方法论：可解释多 Agent 交易链与情绪市场协同进化&lt;/h1&gt;
&lt;h2&gt;（一）总体架构&lt;/h2&gt;
&lt;p&gt;本文的核心方法不是把若干功能环节机械串联，而是构建一个“情绪市场试炼场 + 可解释多 Agent 交易链”的协同进化架构。图 &amp;lt;a href=&quot;#fig:sentiment_market_training&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:sentiment_market_training&quot;&amp;gt;2&amp;lt;/a&amp;gt; 概括外部训练环境：仿真情绪市场提供新闻、行情、情绪反馈与风险冲击，量化 Agent 在其中接受试炼，并把交易结果反馈给策略优化过程。图 &amp;lt;a href=&quot;#fig:method_framework&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:method_framework&quot;&amp;gt;3&amp;lt;/a&amp;gt; 展示 Agent 内部实现：系统接入层连接数据接口、任务调度、交易 Agent 和运行观测模块；交易决策层将市场数据转化为指标状态、新闻情绪、策略候选、风险约束、回测证据、策略记忆和协同判断，最终输出 Buy、Sell、Hold 或 Risk Off 等动作。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:sentiment_market_training&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/sentiment_market_training_overview.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;仿真情绪市场中的量化 Agent 历练流程。传奇交易员的日常生活被抽象为仿真情绪市场，市场中的新闻、行情、情绪与反馈共同构成训练场，量化交易者 Agent 在其中持续试炼、接收反馈并优化策略。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:method_framework&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/hermes_quant_agent_architecture.png&quot; style=&quot;width:82.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes Quant Agent 的总体架构。系统从数据接入、任务调度和运行观测进入交易决策流程，并在指标分析、市场状态识别、新闻情绪、策略选择、风险控制、回测证据和策略记忆之间形成可解释的多 Agent 协同链条。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;因此，与传统端到端预测模型相比，Hermes Agent 的重点不是直接预测涨跌，而是在情绪噪声、风险冲击和反馈迭代中保留每个判断环节，使交易决策能够被观察、被质疑和被修正。&lt;/p&gt;
&lt;h2&gt;（二）多 Agent 协同机制&lt;/h2&gt;
&lt;p&gt;Hermes Agent 的多 Agent 协同并不是让多个 Agent 独立给出买卖建议后简单投票，而是让不同 Agent 承担交易认知链中的不同功能。信息型 Agent 负责把原始市场数据转化为可比较的状态变量；分析型 Agent 负责识别趋势、波动、情绪和策略适配关系；约束型 Agent 负责检查风险、回撤和仓位边界；反思型 Agent 负责发现证据冲突、记录经验并修正后续行为准则。通过这种分工，系统能够把“一个交易决策”拆解为若干可以单独检查的判断环节。&lt;/p&gt;
&lt;p&gt;协同机制可以概括为“先分工、再对齐、后修正”。首先，不同 Agent 分别从价格、技术指标、新闻情绪、历史表现和市场状态中形成局部证据。其次，系统将这些局部证据汇总为统一的决策分数，并显式标记不同证据之间的冲突。例如，新闻情绪可能偏正面，但风险状态可能提示高波动；技术指标可能显示短期上行，但回测表现可能不稳定。最后，风险审查和批判机制对初始决策进行修正，决定是否执行、降低仓位或等待确认。这样，系统输出的不只是交易方向，还包括“为什么现在不应激进交易”的解释。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;功能层&lt;/th&gt;
&lt;th&gt;处理对象&lt;/th&gt;
&lt;th&gt;方法作用&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;市场感知&lt;/td&gt;
&lt;td&gt;行情/成交/新闻/社交/盘口&lt;/td&gt;
&lt;td&gt;多源信息标准化为市场状态&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;专业分析&lt;/td&gt;
&lt;td&gt;技术趋势/情绪状态/策略候选/历史表现&lt;/td&gt;
&lt;td&gt;形成局部证据，避免单一指标支配&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;风险审查&lt;/td&gt;
&lt;td&gt;波动率/回撤/拥挤度/仓位暴露&lt;/td&gt;
&lt;td&gt;施加风险边界与仓位约束&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;协同决策&lt;/td&gt;
&lt;td&gt;Agent 证据/冲突/置信度&lt;/td&gt;
&lt;td&gt;聚合证据，解释冲突并输出建议&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;经验进化&lt;/td&gt;
&lt;td&gt;交易结果/失败归因/成功条件&lt;/td&gt;
&lt;td&gt;沉淀下一轮可复用经验&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Hermes Quant Agent 的功能层与方法作用 {#tab:agent_modules}&lt;/p&gt;
&lt;p&gt;图 &amp;lt;a href=&quot;#fig:agent_modules_frontend&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:agent_modules_frontend&quot;&amp;gt;4&amp;lt;/a&amp;gt; 展示了上述功能层在前端中的可视化映射。系统没有把 Agent 隐藏在后台日志中，而是将市场数据室、指标实验室、策略实验室、风险报警室、决策调度台、执行日志台和报告分析室组织为可观察房间。每个房间对应一个可解释的分析环节，用户可以看到输入数据、输出结果、关键指标和自然语言解释，从而把方法论中的“多 Agent 协同链”转化为可检查的交互界面。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:agent_modules_frontend&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/agent-frontend-modules.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes Quant Agent 功能模块的前端可视化。不同房间对应行情感知、指标分析、策略评估、风险审查、决策调度、执行记录和报告解释等 Agent 模块。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;（三）风险优先的二阶段决策机制&lt;/h2&gt;
&lt;p&gt;系统采用“评分初判 + 风险修正”的二阶段决策机制。第一阶段将策略适配度、市场状态、风险程度、历史表现、技术指标、新闻情绪和经验反馈转化为统一决策分数：
$$
D ={}&amp;amp; 0.30S_{strategy}+0.18S_{regime}+0.18(100-R_{risk}) \
&amp;amp;+0.10S_{backtest}+0.10S_{indicator}+0.09S_{news}+0.05S_{memory}.
$$
其中，$S_{strategy}$ 表示候选策略得分，$S_{regime}$ 表示策略与市场状态的适配度，$R_{risk}$ 为风险分数，$S_{backtest}$ 表示历史表现，$S_{indicator}$ 表示技术指标信号，$S_{news}$ 表示新闻情绪，$S_{memory}$ 表示历史经验加成。该公式的作用不是追求一个绝对正确的分数，而是把不同来源的证据放入同一比较框架，使交易方向、风险和经验可以共同影响最终判断。&lt;/p&gt;
&lt;p&gt;第二阶段对初始交易建议进行风险修正。本文把风险理解为由历史回撤、当前波动、趋势状态和情绪拥挤共同决定的约束，而不是事后附加的止损规则。当市场情绪很热但波动率和拥挤度同步上升时，系统会降低追涨权重；当历史表现较好但当前状态缺少确认时，系统会倾向观望；当新闻情绪与风险状态冲突时，风险约束优先于情绪信号。由此，Hermes Agent 的目标不是成为最激进的收益追逐者，而是在多变市场中保持理性、可解释和可控。&lt;/p&gt;
&lt;h2&gt;（四）Agent 自优化策略&lt;/h2&gt;
&lt;p&gt;Hermes Agent 的自优化策略可以概括为“试炼–评价–反思–沉淀–再试炼”。在仿真情绪市场和历史行情任务中，Agent 首先根据当前市场状态做出交易判断；随后，系统根据收益、风险、回撤、胜率和决策一致性评价该次判断；若结果不理想，系统进一步分析失败来自情绪信号误判、风险约束不足、策略适配错误还是过度观望；最后，系统把这些反思压缩为可复用经验，并作用于下一轮交易。&lt;/p&gt;
&lt;p&gt;SkillOpt 为这一过程提供了更清晰的方法参照。它不直接改变基座模型参数，而是把 skill 文档视为 Agent 的外部可训练状态：前向阶段收集带评分的执行轨迹，反向阶段从成功和失败案例中总结可编辑经验，随后把经验转化为受限的文本更新，并通过验证集门控决定是否写入长期技能，如图 &amp;lt;a href=&quot;#fig:skillopt_loop&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:skillopt_loop&quot;&amp;gt;5&amp;lt;/a&amp;gt; 所示。本文将这一思想迁移到量化交易中：收益、风险、回撤、胜率和多 Agent 冲突记录对应带评分的交易轨迹；策略经验卡片对应候选 skill；风险门控和验证任务对应留出验证检查。由此，Agent 的自优化被定义为可评估的行为准则更新，而不是随意追加运行日志。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:skillopt_loop&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/skillopt_training_loop.png&quot; style=&quot;width:88.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;SkillOpt 的文本空间训练循环示意。该方法将 Agent skill 视为可训练文本状态，通过 rollout、反思、受限更新和验证门控实现稳定的技能进化。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;与普通交易日志不同，本文的经验不是对单次结果的简单描述，而是把多个案例压缩为行为准则。例如，当某类策略在高波动场景中反复出现低胜率和高回撤时，经验系统会倾向于降低其仓位上限；当情绪市场中出现社交热度过快扩散但盘口流动性下降时，经验系统会强化“等待确认”的行为倾向。借鉴 SkillOpt 的思想，行为准则的更新需要经过验证门控：只有能够改善验证场景评价的经验更新才被接受。这保证了自优化不是任意改写规则，而是在可评价结果约束下逐步修正交易者的行为边界。&lt;/p&gt;
&lt;h2&gt;（五）与仿真情绪市场的协同进化&lt;/h2&gt;
&lt;p&gt;本文将仿真情绪市场视为 Hermes Agent 的低成本试炼场。该市场可以构造平稳吸筹、利好拉升、追涨过热、封单松动、谣言扩散、恐慌杀跌和护盘修复等场景。Hermes Agent 在市场中读取价格、成交、新闻、社交热度、风险信号和盘口变化，并输出交易动作、仓位与解释；仿真市场根据交易行为更新订单簿、成交价格、流动性、社交热度和群体情绪；交易结果再反向进入 Agent 的经验总结系统。当 Agent 学到新的风险控制或信号确认经验后，它的后续行为又会改变市场中的交易轨迹。&lt;/p&gt;
&lt;p&gt;图 &amp;lt;a href=&quot;#fig:hermes_session_loop&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:hermes_session_loop&quot;&amp;gt;6&amp;lt;/a&amp;gt; 进一步说明了 Hermes Agent 的经验如何跨轮次保留。一次交易任务结束后，Agent 不只保存原始日志，而是先触发经验检查，将有效反思写入 skill patch，再归档到可检索的会话记忆中。下一轮面对相似市场状态时，系统会从历史会话中取回相关经验，使前一轮试炼的结果能够进入后一轮决策。图 &amp;lt;a href=&quot;#fig:hermes_logo&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:hermes_logo&quot;&amp;gt;7&amp;lt;/a&amp;gt; 所示的标识用于在前端与报告中统一指代这一自进化交易者。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:hermes_session_loop&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/hermes_agent_session_loop.png&quot; style=&quot;width:90.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes Agent 的跨会话经验沉淀流程。交易执行后的经验检查、技能修订、会话归档和下一轮检索共同构成可追踪的自我学习链条。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:hermes_logo&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/hermes_agent_logo.png&quot; style=&quot;width:62.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes Agent 项目标识。本文用 Hermes Agent 指代面向仿真情绪市场进行试炼、反思和行为准则更新的自进化量化交易者。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;因此，本文中的仿真情绪市场不是静态数据集，Hermes Agent 也不是市场外部的观察者。二者共同构成“市场生成情景、Agent 学习经验、Agent 行为反过来改变市场”的互相迭代架构。这一设计可以降低 Agent 自迭代成本，提高其接触不同市场状态的速度，并使研究者能够追踪情绪从新闻、社交传播、订单行为到价格反馈的完整路径。&lt;/p&gt;
&lt;h1&gt;四、实验测试与案例分析&lt;/h1&gt;
&lt;h2&gt;（一）实验目标与可视化环境&lt;/h2&gt;
&lt;p&gt;实验部分主要验证四个问题：第一，系统是否能完整展示多 Agent 量化决策链；第二，仿真情绪市场是否能够呈现新闻、社交传播、盘口变化和 Agent 行为之间的反馈关系；第三，Hermes Agent 是否能利用情绪传播链提前识别拥挤风险并调整交易暴露；第四，Agent 是否能够把多轮交易结果抽象为可观察的经验总结。本文不将仿真结果解释为真实投资收益保证，而是将其用于验证系统流程、展示解释链、识别情绪风险和说明自优化机制。&lt;/p&gt;
&lt;p&gt;图 &amp;lt;a href=&quot;#fig:agent_modules_frontend&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:agent_modules_frontend&quot;&amp;gt;4&amp;lt;/a&amp;gt; 展示了 Hermes Agent 控制室。该界面不是普通的策略回测面板，而是把量化交易过程可视化为“市场数据–指标分析–策略评估–风险报警–决策调度–报告解释”的连续空间。用户可以在一个界面中看到当前资产、运行状态、最终决策、风险等级、组合表现和 Agent 状态。更重要的是，底部详情面板展示了当前房间的输入、输出、关键指标和解释文本，使交易结论不再只是一个孤立的 Buy/Sell/Hold 标签。&lt;/p&gt;
&lt;h2&gt;（二）仿真情绪市场场景展示&lt;/h2&gt;
&lt;p&gt;图 &amp;lt;a href=&quot;#fig:sentiment_overview&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:sentiment_overview&quot;&amp;gt;8&amp;lt;/a&amp;gt; 展示了仿真情绪市场的前端总览。由于该市场属于“金融大数据技术”课程项目，本文只保留一张代表性界面作为交互环境说明。该界面同时呈现市场行情与盘口监控、Agent 群体状态与行为、社交热榜与影响力排行、实验控制与训练反馈。与普通回测界面不同，该市场不仅显示价格曲线，还显示社交热度、资金流、Agent 行为分布和新闻事件，使研究者能够观察市场情绪如何通过投资者网络传播并影响交易行为。对 Hermes Agent 而言，该市场的作用不是直接证明收益，而是提供可控的情绪传播沙盒，用来测试 Agent 在乐观过热、流动性下降和群体行为冲击下是否仍能保持风险约束。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:sentiment_overview&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/sentiment-market-overview.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;仿真情绪市场前端总览。界面展示行情、Agent 状态、社交热榜和实验控制，用于构造可控的情绪传播沙盒。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;（三）Hermes Agent 的交易表现&lt;/h2&gt;
&lt;p&gt;为了检验仿真情绪市场对算法交易者的训练价值，本文将“金融大数据技术”报告中的涨停失败场景迁移到算法交易实验中进行说明。该场景不用于证明某一策略具有真实市场收益，而用于观察 Hermes Agent 是否能够在新闻利好、社交热度上升、盘口拥挤和传闻扩散之间形成更稳健的风险判断。实验设置了一个简单对照：动量基线策略在价格拉升阶段追涨买入，并在恐慌下跌阶段被动卖出；Hermes 情绪感知策略则在早期利好但拥挤度较低时小仓位试探，在社交热度和盘口买盘同时过热时降低暴露，并在封单不足传闻扩散、游资净流出时退出高位仓位，随后在稳定资金入场且卖压衰减时分批低吸。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:hermes_strategy_comparison&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/hermes_strategy_comparison.png&quot; style=&quot;width:92.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Hermes 情绪感知策略与追涨动量基线的收益对比。Hermes 在社交过热和传闻扩散阶段降低仓位，从而避开主要下跌段。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;如图 &amp;lt;a href=&quot;#fig:hermes_strategy_comparison&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:hermes_strategy_comparison&quot;&amp;gt;9&amp;lt;/a&amp;gt; 所示，在该仿真场景结束时，动量基线收益为 -5.10%，Hermes 情绪感知策略收益为 1.66%。更重要的是，二者差异并不只来自最终收益，而来自风险暴露时点的不同：动量基线主要跟随价格变化，因此容易在上涨后段继续追高；Hermes Agent 同时读取社交热度、谣言热度、拥挤度和盘口资金变化，因此能够在价格尚未完全反转前识别“高情绪、高拥挤、低流动性”的风险组合。为保证过程可检查，实验同步记录了 tick 级行情与情绪、新闻事件序列、社交互动路径、关键 Agent 行为轨迹和策略财富曲线，使价格反转、情绪扩散、信息曝光、订单决策和收益变化能够互相印证。由此可见，仿真情绪市场为算法交易者提供的不是普通历史回测曲线，而是一组可解释的市场状态训练样本，帮助 Agent 在情绪驱动行情中区分趋势延续与拥挤反转。&lt;/p&gt;
&lt;h2&gt;（四）决策链展示结果&lt;/h2&gt;
&lt;p&gt;从前端展示结果看，Hermes Agent 将一次交易任务拆解为多个可观察环节。控制室顶部给出当前资产、运行模式、系统状态和最终决策；左侧面板展示当前分析进度、收益预期、风险等级和组合表现；右侧面板展示不同 Agent 的运行状态；底部面板展示当前分析房间的输入、输出和解释。以图 &amp;lt;a href=&quot;#fig:agent_modules_frontend&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:agent_modules_frontend&quot;&amp;gt;4&amp;lt;/a&amp;gt; 中的指标实验室为例，系统不仅给出 RSI、MACD 和波动率数值，还用自然语言解释这些指标对交易行为的含义。由此，实验结果体现出本文系统的核心设计目标：交易建议不是单一数值输出，而是由多 Agent 证据链支撑的可解释结果。&lt;/p&gt;
&lt;p&gt;结合仿真情绪市场，系统进一步展示了“市场状态–群体行为–社交传播–交易反馈”的连续关系。图 &amp;lt;a href=&quot;#fig:sentiment_overview&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:sentiment_overview&quot;&amp;gt;8&amp;lt;/a&amp;gt; 表明，实验界面能够同时呈现行情、Agent 群体状态、社交热榜和实验控制。这样的结果说明，仿真市场可以为 Hermes Agent 提供比普通历史回测更丰富的训练信号：Agent 不只观察价格，还观察情绪扩散、资金拥挤和盘口变化，从而具备识别情绪过热与流动性风险的条件。&lt;/p&gt;
&lt;h2&gt;（五）经验学习模块展示&lt;/h2&gt;
&lt;p&gt;本文进一步通过前端经验模块展示 Agent 的经验积累结果。图 &amp;lt;a href=&quot;#fig:experience_module&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:experience_module&quot;&amp;gt;10&amp;lt;/a&amp;gt; 展示了策略记忆库界面：系统在多轮运行后共形成 41 条单次经验记录，并进一步压缩出 2 类策略级经验摘要。该界面同时展示经验记录数量、策略级摘要、近期运行档案和历史记忆反思，使经验学习不再只是后台记录，而成为可以被观察和复核的实验结果。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:experience_module&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-quant-agent-algorithmic-trading/agent_experience_module.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Agent 经验学习模块前端展示。系统将多轮交易结果压缩为策略级经验摘要，并在运行档案中展示收益、夏普比率、交易信号和经验结论。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;从图 &amp;lt;a href=&quot;#fig:experience_module&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:experience_module&quot;&amp;gt;10&amp;lt;/a&amp;gt; 可以看到，Momentum 策略在样本中取得 39.56% 的平均收益和 1.15 的平均夏普值，但这并不意味着策略已经稳定可靠。收益和夏普反映的是样本期平均表现，低胜率和回撤压力则反映交易路径中的风险暴露，因此经验模块仍将其标记为需要“等待确认、强化多信号一致性、收紧止损”的策略。MA 均线策略取得 61.48% 的平均收益，但平均夏普值为 0.89，说明其在强趋势中有效，却不适合在风险分数升高或指标转弱时盲目加仓。由此可见，Hermes Agent 的学习目标不是简单追求单次或样本期收益最大，而是把收益、胜率、回撤和风险状态共同转化为下一轮可执行、可解释、可验证的行为准则。&lt;/p&gt;
&lt;h1&gt;五、结论与展望&lt;/h1&gt;
&lt;p&gt;本文设计了一个结合仿真情绪市场的可解释多 Agent 量化交易者 Hermes Agent。系统的核心贡献不在于宣称单一收益率提升，而在于把量化交易决策拆解为可观察、可质疑、可修正、可学习的模块化链条。通过前端可视化展示，用户可以看到不同 Agent 如何从行情、指标、新闻、风险和历史经验中形成判断；通过情绪市场沙盒，Agent 可以在新闻冲击、社交传播和盘口反馈构成的可控环境中接受试炼；通过经验抽象和验证门控，Agent 可以把历史表现沉淀为可复用行为准则。该框架为课程中的“仿真情绪市场”和“算法交易 Agent”建立了统一的协同进化架构。&lt;/p&gt;
&lt;p&gt;总体而言，Hermes Agent 将量化交易从“预测价格后给出信号”的单点任务，扩展为“识别市场状态、解释证据冲突、控制风险暴露、沉淀经验准则”的连续过程。它既避免了只依赖价格和指标的机械化交易，也避免了只追随新闻和社交热度的情绪化交易。对于课程项目而言，该系统将算法交易、金融大数据、仿真情绪市场和自优化 Agent 连接成一个完整闭环，为后续研究可解释金融 AI 和自进化交易系统提供了可继续扩展的研究原型。&lt;/p&gt;
&lt;p&gt;99&lt;/p&gt;
&lt;p&gt;Leippold, M., Wang, Q., &amp;amp; Zhou, W. (2022). Machine learning in the Chinese stock market. &lt;em&gt;Journal of Financial Economics&lt;/em&gt;, 145(2), 64–82.&lt;/p&gt;
&lt;p&gt;Liu, X.-Y., Yang, H., Chen, Q., Zhang, R., Yang, L., Xiao, B., &amp;amp; Wang, C. D. (2021). FinRL: Deep reinforcement learning framework to automate trading in quantitative finance. &lt;em&gt;Proceedings of the ACM International Conference on AI in Finance&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Liu, X.-Y., Xia, Z., Rui, J., Gao, J., Yang, H., Zhu, M., Wang, C. D., Wang, Z., &amp;amp; Guo, J. (2022). FinRL-Meta: Market environments and benchmarks for data-driven financial reinforcement learning. &lt;em&gt;NeurIPS Datasets and Benchmarks Track&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Sun, S., Qin, M., Yang, H., Wang, C., Xu, B., &amp;amp; Liu, X.-Y. (2023). TradeMaster: A holistic quantitative trading platform empowered by reinforcement learning. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Sun, S., Wang, R., An, B., &amp;amp; others. (2022). DeepScalper: A risk-aware reinforcement learning framework to capture fleeting intraday trading opportunities. &lt;em&gt;Proceedings of the 31st ACM International Conference on Information and Knowledge Management&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Qin, M., Sun, S., Zhang, W., Zhang, J., Liang, X., Li, Y., &amp;amp; Liu, X.-Y. (2024). EarnHFT: Efficient hierarchical reinforcement learning for high frequency trading. &lt;em&gt;Proceedings of the AAAI Conference on Artificial Intelligence&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Sun, S., An, B., &amp;amp; others. (2023). Mastering stock markets with efficient mixture of diversified trading experts. &lt;em&gt;Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Wu, S., Irsoy, O., Lu, S., Dabravolski, V., Dredze, M., Gehrmann, S., Kambadur, P., Rosenberg, D., &amp;amp; Mann, G. (2023). BloombergGPT: A large language model for finance. &lt;em&gt;arXiv preprint arXiv:2303.17564&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Yang, H., Liu, X.-Y., &amp;amp; Wang, C. D. (2023). FinGPT: Open-source financial large language models. &lt;em&gt;arXiv preprint arXiv:2306.06031&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Yang, H., Zhang, B., Wang, N., Guo, C., Zhang, X., Lin, L., Wang, J., Zhou, T., Guan, M., Zhang, R., &amp;amp; Wang, C. D. (2024). FinRobot: An open-source AI agent platform for financial applications using large language models. &lt;em&gt;arXiv preprint arXiv:2405.14767&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Zhang, W., Yang, H., &amp;amp; others. (2024). FinAgent: A multimodal foundation agent for financial trading. &lt;em&gt;Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Yu, Y., Wang, Z., &amp;amp; others. (2025). FinMem: A performance-enhanced LLM trading agent with layered memory and character design. &lt;em&gt;IEEE Transactions on Big Data&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;TradingAgents. (2024). TradingAgents: Multi-agents LLM financial trading framework. &lt;em&gt;arXiv preprint arXiv:2412.20138&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Yu, Y., Yao, Z., Li, H., Deng, Z., Cao, Y., Chen, Z., Suchow, J. W., Liu, R., Cui, Z., Xu, Z., Zhang, D., Subbalakshmi, K., Xiong, G., He, Y., Huang, J., Li, D., &amp;amp; Xie, Q. (2024). FinCon: A synthesized LLM multi-agent system with conceptual verbal reinforcement for enhanced financial decision making. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Li, Y., Zhang, Y., &amp;amp; others. (2025). InvestorBench: A benchmark for financial decision-making tasks with LLM-based agents. &lt;em&gt;Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;HedgeAgents. (2025). HedgeAgents: A balanced-aware multi-agent financial trading system. &lt;em&gt;Proceedings of the ACM International Conference on AI in Finance&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Zhang, Y., Wang, H., &amp;amp; others. (2024). StockAgent: Large language model-based stock trading in simulated real-world environments. &lt;em&gt;arXiv preprint&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Li, J., Zhang, Y., &amp;amp; others. (2024). MarS: A financial market simulation engine powered by generative foundation model. &lt;em&gt;arXiv preprint&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Yang, Y., Gong, Z., Huang, W., Yang, Q., Zhou, Z., Huang, Z., Li, Y., Gao, X., Dai, Q., Liu, B., Qiu, K., Yang, Y., Chen, D., Yang, X., &amp;amp; Luo, C. (2026). SkillOpt: Executive strategy for self-evolving agent skills. &lt;em&gt;arXiv preprint arXiv:2605.23904&lt;/em&gt;.&lt;/p&gt;
</content:encoded></item><item><title>传奇交易员的日常生活</title><link>https://www.whalefall.top/posts/hermes-em-financial-big-data/</link><guid isPermaLink="true">https://www.whalefall.top/posts/hermes-em-financial-big-data/</guid><description>以 Hermes-EM 为核心，介绍多 Agent 金融情绪市场、角色行为、技能进化机制与可视化实验结果。</description><pubDate>Fri, 31 Jul 2026 00:10:00 GMT</pubDate><content:encoded>&lt;hr /&gt;
&lt;p&gt;&lt;strong&gt;传奇交易员的日常生活&lt;/strong&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;刘勇杰&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;李家豪&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;西南财经大学&lt;/td&gt;
&lt;td&gt;西南财经大学&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Abstract&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;金融市场价格并不只由基本面和历史收益决定，新闻冲击、投资者注意力、社交互动和群体情绪也会共同改变交易行为。与“算法交易”报告中的自进化量化交易者相对应，本文将“传奇交易员的日常生活”定义为 Hermes Quant Agent（下称 Hermes Agent）的情绪市场试炼场，并将系统命名为 Hermes-EM：市场既生成新闻、社交传播、盘口冲击和群体交易行为，也让不同市场角色在交易反馈中持续更新自身 Skill。本文设计了一个面向 A 股市场的多智能体情绪传播仿真系统，通过限价订单簿、A 股交易规则、仿真新闻生成器、社交网络推荐机制和动态市场环境刻画“新闻–情绪–社交传播–交易行为–价格反馈”的闭环。进一步地，本文引入 Darwin.SKILL 式人物 Skill 蒸馏思想，为散户、游资、价值资金、量化研究员和 Hermes Agent 等角色配置初始行为倾向，并通过交易反馈、经验反思、候选 Skill 更新和验证门控形成可进化的市场参与者。实验构造了“平稳吸筹–利好拉升–追涨过热–封单松动–恐慌杀跌–护盘修复”的涨停失败场景。结果表明，情绪传播链不仅能够解释价格剧烈反转前的社交热度、盘口失衡和流动性收缩，还能为 Hermes Agent 提供比单纯价格动量更稳健的风险识别信号。项目代码见 GitHub：&lt;a href=&quot;https://github.com/HanaViolet/Hermes-EM&quot;&gt;&lt;code&gt;HanaViolet/Hermes-EM&lt;/code&gt;&lt;/a&gt;。&lt;/p&gt;
&lt;p&gt;A 股仿真市场；多智能体系统；投资者情绪；角色 Skill 蒸馏；自进化 Agent；算法交易&lt;/p&gt;
&lt;h1&gt;一、引言&lt;/h1&gt;
&lt;p&gt;投资者情绪是解释金融市场短期波动的重要变量。行为金融学表明，噪声交易者风险、信息瀑布、注意力驱动买入和媒体语调都会导致价格偏离基本面。在 A 股市场中，这一问题更为突出：个人投资者占比高、涨跌停制度显著、热点题材和短线资金行为容易形成交易拥挤，价格限制机制甚至可能诱发“涨停吸引买盘、次日或随后反转”的破坏性市场行为。因此，若算法交易系统只学习价格和成交量，而忽略情绪如何被新闻、社交网络和推荐机制放大，就很难在真实市场中识别诱多、出货、恐慌踩踏等高风险过程。&lt;/p&gt;
&lt;p&gt;已有研究为“用多智能体刻画情绪市场”提供了重要依据。人工股票市场和多智能体建模能够从微观交易规则出发，复现收益厚尾、波动聚集和临界行为等宏观现象；社会互动和从众行为研究则说明，投资者并非独立决策，邻居、社交网络和群体信念会影响市场参与与风险承担。与此同时，文本金融研究发现，新闻语调、财报词典和搜索行为均与资产价格和波动有关。这些研究共同表明，情绪传播不是外生噪声，而是金融市场仿真中需要显式建模的机制。&lt;/p&gt;
&lt;p&gt;然而，传统研究多从实证相关性角度讨论情绪与市场表现，例如检验新闻语调是否预测收益、社交媒体情绪是否领先指数变化，或投资者注意力是否解释散户买入。此类工作能够回答“情绪传播之后发生了什么”，但较难展示“情绪沿哪些节点、通过哪些推荐和互动路径传播，并最终如何改变不同投资者的订单行为”。因此，本文从仿真市场内部重建情绪传播链：新闻事件先改变 Agent 的信念和风险偏好，Agent 再通过社交帖子、点赞、收藏、转发和关注关系形成传播网络，推荐算法进一步放大高热度信息，最后由不同类型 Agent 的交易策略反馈到价格、盘口深度和市场情绪。&lt;/p&gt;
&lt;p&gt;本文与“算法交易”报告形成互补关系：算法交易报告关注自进化量化交易员如何形成可解释交易决策，本文则关注该交易员所处的情绪市场如何生成信息、传播情绪并反馈到价格。换言之，本文不把仿真市场视为静态数据集，而是将其设计为一个可反复试炼、可记录反馈、可与交易 Agent 共同演化的训练环境。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:intro_legendary_trader_life&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/intro_legendary_trader_life.png&quot; style=&quot;width:86.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;本文方法的概念入口：“传奇交易员的日常生活”被设定为 Hermes Agent 面对新闻、社交情绪、盘口冲击和角色进化的市场试炼场。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;围绕这一定位，本文的主要工作包括五点。第一，提出面向 A 股的情绪传播仿真市场架构，将交易制度、订单簿、市场状态和多类投资者放入同一解释框架。第二，设计动态市场环境，使新闻不再直接决定价格，而是通过多 Agent 交互、社交传播和订单簿反馈生成多样化市场路径。第三，构建准真实社交网络和推荐曝光机制，使情绪能够沿关注关系、热榜内容和互动行为被追踪。第四，引入 Darwin.SKILL 式人物 Skill 蒸馏，为市场角色配置初始行为倾向，并通过交易结果和经验反思持续更新角色 Skill。第五，为 Hermes Agent 提供带有新闻、情绪、社交热度和盘口信号的训练环境，用于学习市场情绪传播链和交易风险识别。&lt;/p&gt;
&lt;h1&gt;二、相关工作&lt;/h1&gt;
&lt;h2&gt;（一）投资者情绪、新闻与市场价格&lt;/h2&gt;
&lt;p&gt;投资者情绪研究通常从两个入口展开：一类从行为金融理论出发，讨论噪声交易、过度反应、信息瀑布和动量反转；另一类从可观测文本和注意力数据出发，研究媒体内容、财报语调或搜索指数对资产价格的预测能力。这些研究说明，情绪并非无法度量，而是可以通过新闻文本、搜索行为、交易活跃度和社交表达间接刻画。本文借鉴这一思路，将新闻事件的方向、强度、可信度和衰减过程转化为 Agent 的情绪增量和交易倾向。&lt;/p&gt;
&lt;p&gt;在 A 股环境下，情绪和微观结构的交互尤其重要。涨跌停制度、散户主导的交易结构和高换手率会放大短线注意力，价格接近涨停时可能吸引更多买盘，并在封单失败或大资金撤退后产生剧烈反转。因此，本文的实验不采用一般的单调利好场景，而选择“涨停失败/诱多回落”作为测试案例，用以展示情绪传播链如何帮助 Hermes Agent 识别价格上涨背后的拥挤风险。&lt;/p&gt;
&lt;h2&gt;（二）社交传播与推荐算法&lt;/h2&gt;
&lt;p&gt;社会传播研究表明，行为扩散依赖网络结构、邻居影响和群体强化机制，大规模社交网络中也存在可观测的情绪传染现象。在投资语境下，社交互动不仅影响是否参与市场，也会影响个体对信息可信度和风险的判断。推荐算法进一步改变了信息暴露结构：它不只是被动展示帖子，而会根据互动、热度、关注关系和时间衰减重新排序内容；从协同过滤到深度候选召回与排序模型，推荐系统已经成为塑造信息流的重要基础设施。同时，生成式 Agent 研究表明，通过记忆、规划和交互机制可以构造具有连续行为轨迹的个体模拟。本文在仿真系统中引入“关注者内容 + 全站热榜”的混合推荐机制，使得情绪传播既有社交邻接路径，也有平台算法放大路径。&lt;/p&gt;
&lt;h2&gt;（三）多智能体金融市场仿真&lt;/h2&gt;
&lt;p&gt;多智能体金融市场将宏观价格波动分解为微观交易规则、异质信念和局部互动。经典人工股票市场研究表明，只要 Agent 具有异质预期和适应性学习，就可能产生复杂时间序列性质；随机多智能体模型也能复现金融市场的标度律和临界现象。更一般地，Agent-based modelling 被认为是处理金融系统非线性反馈、异质主体和政策冲击的重要工具。本文在此基础上增加了新闻和社交推荐模块，使 Agent 的情绪不再是静态参数，而是在市场中动态传播和反馈。&lt;/p&gt;
&lt;h2&gt;（四）自进化 Agent 与 Skill 蒸馏&lt;/h2&gt;
&lt;p&gt;生成式 Agent 研究强调，记忆、规划和交互可以让个体模拟呈现连续行为轨迹。进一步地，SkillOpt 将 Agent 的外部化 skill 文档视为可训练状态：系统先收集带评分的 rollout 轨迹，再通过反思生成候选 skill 修改，并用验证门控决定是否接受更新。Darwin.SKILL 则从工程实践角度提供了“人物 Skill 蒸馏”的可复用思路，即把特定人物或角色的决策风格、语言偏好和行为准则压缩为可安装、可组合、可迭代的 Skill。这些工作说明，Agent 的能力不必只存在于模型参数中，也可以沉淀为可解释、可编辑、可验证的外部行为规则。本文借鉴的是这种“Skill 可蒸馏、可更新”的机制，而不是直接照搬非金融人物设定。&lt;/p&gt;
&lt;h2&gt;（五）本文定位&lt;/h2&gt;
&lt;p&gt;已有研究分别解释了情绪变量、信息传播、推荐排序、人工市场和 Agent 自优化，但较少把这些模块放入同一个可交互、可演化的 A 股仿真环境。本文关注的不是单一新闻因子是否预测收益，而是新闻如何进入 Agent 认知、如何通过社交网络扩散、如何被推荐算法放大，以及如何经由订单簿影响价格。进一步地，本文把市场参与者自身也设计为可进化对象，使情绪市场不只是 Hermes Agent 的训练场，也是不同角色 Skill 共同迭代的实验环境。&lt;/p&gt;
&lt;h1&gt;三、方法论&lt;/h1&gt;
&lt;p&gt;本节从设计层面描述情绪传播仿真市场。本文的目标不是复现某一条固定价格序列，而是在 A 股交易规则约束下构造一个可交互、可解释、可重复实验的人工市场。该市场借鉴人工股票市场和多智能体金融建模思想，将投资者情绪从外生指标推进为可追踪的传播过程：新闻影响 Agent 认知，社交网络改变信息暴露，异质主体把信念转化为订单，市场价格和流动性再反向影响下一轮决策。&lt;/p&gt;
&lt;h2&gt;（一）A 股情绪传播仿真市场架构&lt;/h2&gt;
&lt;p&gt;A 股市场具有个人投资者参与度高、价格涨跌停约束明显、短线题材传播快和盘口流动性易变化等特征。为了刻画这些机制，本文将仿真市场设计为五个层次：外部信息层、投资者认知层、社交传播层、A 股交易层和策略学习层，如图 &amp;lt;a href=&quot;#fig:market_design_architecture&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:market_design_architecture&quot;&amp;gt;2&amp;lt;/a&amp;gt; 所示。外部信息层产生公告、媒体报道、研报和市场传闻；投资者认知层由散户、游资、公募基金、北向资金、国家队、普通量化和 Hermes Agent 等异质主体组成；社交传播层决定信息在关注网络和热榜中的曝光；A 股交易层通过订单簿、价格优先规则、100 股整数倍和涨跌停约束完成价格发现；策略学习层记录收益、回撤和风险信号，供 Hermes Agent 学习。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:market_design_architecture&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/market_design_architecture.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;A 股情绪传播仿真市场的设计架构。图中只保留关键层次和闭环关系，强调新闻、社交传播、订单行为和策略学习之间的解释链条。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;这种分层设计的作用在于把“情绪影响价格”的黑箱关系拆解为一条可解释链路。行为金融研究说明，噪声交易、注意力驱动买入和信息瀑布会造成短期价格偏离；多智能体金融市场研究进一步表明，异质预期和局部交互可以产生波动聚集、厚尾和非线性反馈等宏观现象。因此，本文不把情绪作为单一数值直接作用于价格，而是让情绪先改变 Agent 的认知和风险偏好，再通过社交传播与订单簿反馈进入市场状态。&lt;/p&gt;
&lt;p&gt;系统中的 Agent 被设计为不同市场参与者的抽象画像。散户更容易受到热榜和传闻影响，具有追涨杀跌和从众倾向；游资关注涨停接力、封板强度和撤退阈值；公募基金以估值锚和组合再平衡为主要约束；北向资金对趋势和宏观风险更敏感；国家队在极端下跌或流动性不足时提供稳定买盘；普通量化利用动量、均值回归和盘口不平衡信号；Hermes Agent 则作为学习型交易员，在同一市场中观察传播链、评估风险并调整交易暴露。这样的角色划分并非为了精确复制某一类真实机构，而是为了在实验中形成足够丰富的异质行为和相互反馈。&lt;/p&gt;
&lt;p&gt;为了让上述方法结构可以被直接观察，本文同时构建了前端可视化界面。多 Agent 市场沙盘将不同资金类型放入同一空间化市场环境中，便于观察异质主体在新闻、盘口和社交传播冲击下的位置关系与行动状态；Agent 群体卡片则把每类主体的现金、持仓、收益、行为倾向和动作流程集中展示，使角色设定不只停留在参数表中，而能被追踪为可交互的市场参与者。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:frontend_market_sandbox_method&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/frontend_market_sandbox_method.png&quot; style=&quot;width:96.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;多 Agent 市场沙盘前端界面。不同市场角色被放置在同一仿真空间中，研究者可以直观看到资金类型、角色位置和市场场景之间的对应关系。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;沙盘视图强调“市场环境中的谁在哪里”，适合观察异质资金如何共同进入同一交易场景；而角色卡片视图进一步回答“每类 Agent 正在做什么”。因此，前端展示被设计为由宏观空间视图下钻到微观角色视图：前者用于理解市场结构，后者用于追踪每类主体的观察、决策、委托和反馈过程。&lt;/p&gt;
&lt;p&gt;在实现上，沙盘并不替代订单簿和情绪传播模型，而是把模型中的抽象主体、市场区域和交互状态映射为可观察对象。研究者可以先从沙盘中定位哪些资金正在参与、哪些角色处于同一信息环境，再进入卡片视图查看其情绪、持仓和动作链条。这样的前端组织方式使方法部分的“多主体–多路径–可反馈”设计具有可检查的界面入口。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:frontend_agent_cards_method&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/frontend_agent_cards_method.png&quot; style=&quot;width:82.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Agent 群体卡片与动作流程前端界面。界面展示每类 Agent 的资产状态、持仓、收益、行为偏好和观察、决策、委托、反馈等动作环节。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;（二）Darwin.SKILL 驱动的人物角色蒸馏与自进化&lt;/h2&gt;
&lt;p&gt;为了让仿真市场中的角色不只是固定参数集合，本文引入 Darwin.SKILL 式人物 Skill 蒸馏机制。该机制参考 Darwin.SKILL 开源项目（&lt;a href=&quot;https://github.com/alchaincyf/darwin-skill&quot;&gt;GitHub 仓库&lt;/a&gt;），其基本思想是：每个市场参与者先拥有一个初始角色 Skill，定义其信息偏好、风险态度、社交表达方式和交易反应；随后，角色在市场中经历新闻冲击、社交传播、收益反馈和失败案例；最后，系统将这些轨迹压缩为候选 Skill 更新，并通过验证门控决定是否写入下一轮角色行为。由此，散户、游资、价值资金、量化研究员和 Hermes Agent 都可以在同一情绪市场中逐步形成更稳定的行为倾向。&lt;/p&gt;
&lt;p&gt;更具体地说，Darwin.SKILL 不是一次性写出固定提示词，而是把 Skill 视为可迭代的外部行为规则。系统先评估当前 Skill 在任务中的表现，再生成改进方案，并通过验证集和人工确认判断改动是否真正提升能力；只有当分数上升时，候选 Skill 才会被保留，否则回滚到上一稳定版本，如图 &amp;lt;a href=&quot;#fig:darwin_skill_core_loop&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:darwin_skill_core_loop&quot;&amp;gt;5&amp;lt;/a&amp;gt; 所示。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:darwin_skill_core_loop&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/darwin_skill_core_loop.png&quot; style=&quot;width:90.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Darwin.SKILL 的核心优化闭环。系统依次完成评估、改进、验证和确认，并根据分数是否提升决定保留或回滚候选 Skill。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;该机制的关键在于“只让有效基线向上移动”。换言之，每一轮优化都必须超过已有稳定版本，失败候选不会覆盖当前 Skill。对于本文的金融市场仿真而言，这意味着市场角色可以从交易结果和风险暴露中学习，但不会因为单次噪声反馈而破坏原有角色一致性，如图 &amp;lt;a href=&quot;#fig:darwin_skill_ratchet&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:darwin_skill_ratchet&quot;&amp;gt;6&amp;lt;/a&amp;gt; 所示。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:darwin_skill_ratchet&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/darwin_skill_ratchet_mechanism.png&quot; style=&quot;width:86.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Darwin.SKILL 的棘轮机制。有效基线只在验证得分提升时更新，低于当前基线的候选版本被拒绝，从而保持 Skill 迭代的稳定性。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;在角色初始化阶段，本文不追求逐字复刻某位真实人物，而是借鉴人物 Skill 蒸馏思想，为不同市场角色提供可解释的初始行为来源。具体而言，散户学习者借鉴彼得·林奇面向普通投资者的公司理解和长期观察方式；投机交易者借鉴杰西·利弗莫尔对趋势、仓位和止损的交易纪律；宏观交易者借鉴乔治·索罗斯的反身性思想和宏观冲击判断；价值守门员借鉴巴菲特与芒格的安全边际、长期主义和逆向思考；量化研究员借鉴 Jim Simons 与 Cliff Asness 的数据建模、因子验证和组合研究方法；风险控制者借鉴塔勒布与达利欧对不确定性、尾部风险和组合防御的理解。Hermes Agent 则不是某一人物的复制体，而是在上述市场角色共同构成的情绪市场中接受试炼，并把交易结果压缩为可验证的行为准则。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;市场人物 Skill 蒸馏与仿真行为&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;市场角色&lt;/th&gt;
&lt;th&gt;蒸馏参考&lt;/th&gt;
&lt;th&gt;仿真行为作用&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;散户学习者&lt;/td&gt;
&lt;td&gt;彼得·林奇&lt;/td&gt;
&lt;td&gt;关注公司故事、产品认知和大众可理解信息，刻画普通投资者的学习型买入与情绪跟随。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;投机交易者&lt;/td&gt;
&lt;td&gt;杰西·利弗莫尔&lt;/td&gt;
&lt;td&gt;强调趋势、仓位、止损和撤退纪律，刻画短线资金在拉升与反转中的快速行动。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;宏观交易者&lt;/td&gt;
&lt;td&gt;乔治·索罗斯&lt;/td&gt;
&lt;td&gt;强调反身性和宏观冲击，刻画政策、流动性和市场预期之间的反馈。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;价值守门员&lt;/td&gt;
&lt;td&gt;巴菲特 / 芒格&lt;/td&gt;
&lt;td&gt;强调安全边际、长期主义和逆向思考，提供估值锚与情绪过热时的约束。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;量化研究员&lt;/td&gt;
&lt;td&gt;Jim Simons / Cliff Asness&lt;/td&gt;
&lt;td&gt;强调数据建模、因子验证和组合研究，为价格、盘口和情绪信号提供量化解释。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;风险控制者&lt;/td&gt;
&lt;td&gt;塔勒布 / 达利欧&lt;/td&gt;
&lt;td&gt;强调尾部风险、反脆弱和组合防御，在恐慌扩散与流动性收缩时约束风险暴露。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:darwin_skill_persona_market&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/darwin_skill_persona_market.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;市场人物 Skill 蒸馏驱动的情绪市场角色初始化与自进化示意。不同像素人物从投资交易代表人物中获得初始行为倾向，并在交易反馈、经验反思、Skill 更新和再次入场之间形成闭环。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;从方法角度看，若将第 $i$ 个市场角色的 Skill 表示为 $K_i^t$，其在第 $t$ 轮市场中的交易、发帖、互动和收益轨迹表示为 $\tau_i^t$，则角色更新可以抽象为
$
K_i^{t+1}=\mathcal{G}(K_i^t,\tau_i^t,R_i^t,V_i),
$
其中 $R_i^t$ 表示收益、回撤、社交影响力和风险暴露等评价结果，$V_i$ 表示验证门控。只有当候选更新能在保留角色一致性的同时改善验证场景表现时，该更新才会进入下一轮市场。这样的设计使仿真情绪市场本身成为自进化系统：市场角色会根据过往成功和失败调整行为准则，而这些调整又会影响下一轮新闻传播、订单行为和价格反馈。对 Hermes Agent 而言，训练环境不再是静态沙盒，而是一个会随参与者共同学习而改变的试炼场。&lt;/p&gt;
&lt;h2&gt;（三）动态市场设计：多 Agent 交互与路径非唯一性&lt;/h2&gt;
&lt;p&gt;真实市场不是新闻冲击到价格变化的单向映射。同一条利好新闻可能被机构视为估值修复，被游资视为打板机会，被散户理解为追涨信号，也可能在传闻反转后演化为恐慌踩踏。为刻画这种路径非唯一性，本文将市场环境表示为随 tick 演化的状态：
$
E_t=(S_t,\sigma_t,F_t,L_t,Q_t,C_t,N_t),
$
其中 $S_t$ 表示市场情绪，$\sigma_t$ 表示波动率，$F_t$ 表示资金流，$L_t$ 表示流动性，$Q_t$ 表示盘口深度，$C_t$ 表示交易拥挤度，$N_t$ 表示最近新闻冲击。环境的下一期状态由新闻、订单和社交互动共同决定：
$
E_{t+1}=\Phi(E_t,N_t,O_t,G_t)+\epsilon_t,
$
其中 $O_t$ 为多 Agent 产生的订单集合，$G_t$ 为社交互动网络，$\epsilon_t$ 表示异质性和随机扰动。该式强调的是设计逻辑：新闻只给出外部状态，真正的市场路径由 Agent 之间的认知差异、传播差异和交易反馈共同生成。&lt;/p&gt;
&lt;p&gt;在仿真实现中，上述状态变量会被同步写入事件日志和前端面板。价格、波动率和盘口深度用于刻画交易层变化，资金流和交易拥挤度用于识别短线资金是否过度集中，社交互动网络则记录帖子、关注和推荐曝光如何改变 Agent 的信息集合。这样一来，同一条新闻可以在不同角色之间形成不同的认知路径，最终表现为不同的下单节奏和风险暴露。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:dynamic_agent_market&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/dynamic_agent_market.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;动态多 Agent 市场环境示意。外部新闻并不直接决定价格，而是通过异质 Agent 的认知更新、社交互动和订单簿反馈形成多条可能路径。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;在每个 tick 中，Agent 会根据自身角色读取新闻、社交 feed、价格、盘口、资金流和历史收益，并形成新的情绪和交易倾向。随后，订单进入 A 股规则约束下的订单簿，成交结果改变价格、流动性和未成交队列；这些市场结果又被 Agent 观察，并影响下一轮发帖、跟随、撤单或反向交易。该闭环使市场变化不再是预设曲线，而是由“认知–传播–交易–反馈”的连续交互产生。对于 Hermes Agent 而言，学习目标也不再是简单预测下一 tick 涨跌，而是在动态环境中识别何时上涨来自基本面改善，何时上涨只是社交推荐和短线资金共同放大的拥挤交易。&lt;/p&gt;
&lt;h2&gt;（四）准真实社交网络与推荐算法&lt;/h2&gt;
&lt;p&gt;情绪传播需要同时刻画人际网络和平台曝光。本文将每个 Agent 视为社交网络中的节点，关注关系、点赞、收藏、转发和评论构成有向加权边。帖子内容来自 Agent 对新闻和市场状态的解释，类型包括观点、传闻、分析和预警。互动概率由三类因素共同决定：第一，信息是否符合接收者当前情绪和持仓方向；第二，发帖者是否具有较高影响力或同类身份；第三，推荐系统是否把该内容放入更靠前的曝光位置。这样的设计借鉴了社会扩散与情绪传染研究，使市场情绪不只是全局平均值，而是可以沿节点和边追踪的传播过程。&lt;/p&gt;
&lt;p&gt;推荐机制采用“关注流 + 热榜流”的混合结构。关注流保留社交邻接关系，使 Agent 更容易接收熟悉节点或同类群体的观点；热榜流按照互动强度和时间衰减排序，模拟平台对高热度内容的放大效应。帖子热度定义为：
$
H(p,t)=\frac{L_p+2C_p+3R_p}{(\Delta t/30+2)^{1.5}},
$
其中 $L_p$、$C_p$、$R_p$ 分别为点赞、收藏和转发次数，$\Delta t$ 为帖子年龄。每个 Agent 的推荐流主要来自关注对象的高分帖子，同时保留一定比例的全站热榜内容。该设计既能形成同温层，也能让极端情绪、传闻或风险预警跨越原有关注边界扩散。&lt;/p&gt;
&lt;p&gt;社交推荐机制在本文中承担两类功能。第一，它提供情绪传播的可解释路径：研究者可以观察某条利好、传闻或澄清信息经过哪些节点、被哪些互动放大，并最终影响哪些交易行为。第二，它为 Hermes Agent 提供更接近真实市场的信息环境：量化交易员看到的不仅是价格和成交量，还包括热度、拥挤度、意见领袖观点和风险帖扩散速度。由此，Hermes Agent 可以学习把“社交热度上升”区分为基本面确认、情绪过热或风险传导，而不是把所有热度都理解为买入信号。&lt;/p&gt;
&lt;p&gt;上述四部分共同限定了本文的研究对象：本文关注“情绪如何传播并改变交易行为”，而不是单纯回放行情。市场架构提供制度约束，角色蒸馏机制提供可演化的异质主体，动态环境提供多路径反馈，社交推荐机制提供可追踪的信息暴露路径，四者共同构成面向算法交易训练的 A 股情绪传播仿真市场。&lt;/p&gt;
&lt;h1&gt;四、实验测试与案例分析&lt;/h1&gt;
&lt;h2&gt;（一）实验场景设计&lt;/h2&gt;
&lt;p&gt;实验采用仿真数据而非真实交易数据，目的是展示报告所需的市场现象和传播链条。场景命名为“涨停失败/主力诱多”：前 20 个 tick 价格围绕 10 元平稳波动；第 22 个 tick 出现订单利好；第 36 个 tick 游资集中买入并发布看多内容，推荐系统放大热度；第 48 个 tick Hermes 识别到社交热度、拥挤度和盘口买盘同时过热；第 52 个 tick 出现封单不足传闻；第 56 个 tick 游资撤退；第 64 个 tick 买盘深度快速下降，散户恐慌扩散；第 74 个 tick 稳定资金入场，价格和情绪开始修复。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;tick 区间&lt;/th&gt;
&lt;th&gt;均价&lt;/th&gt;
&lt;th&gt;最高价&lt;/th&gt;
&lt;th&gt;平均情绪&lt;/th&gt;
&lt;th&gt;平均拥挤度&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;稳定吸筹&lt;/td&gt;
&lt;td&gt;0–20&lt;/td&gt;
&lt;td&gt;10.00&lt;/td&gt;
&lt;td&gt;10.03&lt;/td&gt;
&lt;td&gt;0.00&lt;/td&gt;
&lt;td&gt;0.10&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;利好铺垫&lt;/td&gt;
&lt;td&gt;21–34&lt;/td&gt;
&lt;td&gt;10.26&lt;/td&gt;
&lt;td&gt;10.48&lt;/td&gt;
&lt;td&gt;0.28&lt;/td&gt;
&lt;td&gt;0.31&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;拉升追涨&lt;/td&gt;
&lt;td&gt;35–48&lt;/td&gt;
&lt;td&gt;10.71&lt;/td&gt;
&lt;td&gt;10.92&lt;/td&gt;
&lt;td&gt;0.66&lt;/td&gt;
&lt;td&gt;0.63&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;封单松动&lt;/td&gt;
&lt;td&gt;49–60&lt;/td&gt;
&lt;td&gt;10.51&lt;/td&gt;
&lt;td&gt;10.87&lt;/td&gt;
&lt;td&gt;0.25&lt;/td&gt;
&lt;td&gt;0.68&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;恐慌杀跌&lt;/td&gt;
&lt;td&gt;61–72&lt;/td&gt;
&lt;td&gt;9.76&lt;/td&gt;
&lt;td&gt;10.03&lt;/td&gt;
&lt;td&gt;-0.50&lt;/td&gt;
&lt;td&gt;0.76&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;护盘修复&lt;/td&gt;
&lt;td&gt;73–90&lt;/td&gt;
&lt;td&gt;9.69&lt;/td&gt;
&lt;td&gt;9.88&lt;/td&gt;
&lt;td&gt;-0.36&lt;/td&gt;
&lt;td&gt;0.57&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;涨停失败场景的阶段统计 {#tab:phase}&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:price_sentiment&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/price_sentiment.png&quot; style=&quot;width:92.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;价格与市场情绪在涨停失败场景中的共同变化。价格先被利好和游资行为推高，随后在传闻与流动性冲击下快速下行。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;除曲线结果外，本文还截取了实验过程中的界面细节作为可视化证据。图 &amp;lt;a href=&quot;#fig:experiment_frontend_details&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:experiment_frontend_details&quot;&amp;gt;10&amp;lt;/a&amp;gt; 展示了价格拉升与成交放大、Agent 群体状态、社交热榜与影响力排行、盘口新闻和资金流等关键画面，使涨停失败场景不只由价格曲线呈现，也能看到传播链在仿真市场中的具体表现。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:experiment_frontend_details&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/experiment_frontend_details.png&quot; style=&quot;width:98.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;涨停失败实验的前端细节截图。四个子图分别展示价格拉升与成交放大、Agent 群体状态、社交热榜与影响力、盘口新闻和资金流，补充说明情绪传播链在实验界面中的可观察性。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;（二）传播链与微观结构信号&lt;/h2&gt;
&lt;p&gt;从传播链看，利好新闻最先推动散户和游资情绪升温；游资看多帖子在推荐流中获得较高点赞和转发，散户情绪随后更剧烈地上升；当封单不足传闻出现后，热榜内容从“追涨”切换为“风险提醒”，谣言热度迅速超过普通社交热度。此时价格虽然仍处于高位，但订单簿不平衡已经从买盘占优转向卖压占优，流动性开始收缩。也就是说，情绪传播链比价格更早暴露了市场结构变化。&lt;/p&gt;
&lt;p&gt;从界面读图顺序看，价格与成交面板给出行情结果，Agent 群体状态面板解释哪些主体正在承担风险，社交热榜与影响力面板揭示情绪扩散来源，盘口与资金流面板则显示交易压力如何落到订单簿上。四类信息合在一起，使本文的实验不只是“价格先涨后跌”的回放，而是能够追踪新闻、情绪、社交互动和盘口反馈如何共同推动市场状态改变。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:social_spread&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/social_spread.png&quot; style=&quot;width:92.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;社交热度、传闻热度与拥挤度变化。传闻出现后，推荐系统将风险帖子推到更高位置，情绪由乐观转为恐慌。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:microstructure&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/hermes-em-financial-big-data/microstructure_signals.png&quot; style=&quot;width:92.0%&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;盘口不平衡、流动性和拥挤度变化。封单松动后，拥挤度仍高但流动性下降，形成高风险交易区间。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;为保证实验过程可检查，本文同步记录了 tick 级行情与情绪、新闻事件序列、社交互动路径和关键 Agent 行为轨迹。上述记录分别对应价格反转、情绪扩散、信息曝光和订单决策四个观测层面，用于支撑图 &amp;lt;a href=&quot;#fig:price_sentiment&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:price_sentiment&quot;&amp;gt;9&amp;lt;/a&amp;gt;、图 &amp;lt;a href=&quot;#fig:social_spread&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:social_spread&quot;&amp;gt;11&amp;lt;/a&amp;gt; 和图 &amp;lt;a href=&quot;#fig:microstructure&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:microstructure&quot;&amp;gt;12&amp;lt;/a&amp;gt; 的曲线结果，并与图 &amp;lt;a href=&quot;#fig:experiment_frontend_details&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:experiment_frontend_details&quot;&amp;gt;10&amp;lt;/a&amp;gt; 的过程截图相互印证。&lt;/p&gt;
&lt;h1&gt;五、结论与展望&lt;/h1&gt;
&lt;p&gt;本文设计了一个面向 A 股市场的多智能体情绪传播仿真系统，并将其定位为 Hermes Quant Agent 的可解释试炼场。与只观察情绪结果的研究不同，本文强调情绪传播链：新闻从不同来源进入 Agent 认知，社交网络和推荐算法放大或反转情绪，异质交易策略将情绪转化为订单，价格、流动性和成交再反过来更新市场环境。进一步地，本文通过 Darwin.SKILL 式人物 Skill 蒸馏，将市场参与者也纳入自进化框架，使仿真市场能够与算法交易报告中的自进化量化交易员形成互相迭代的结构。实验结果和界面细节截图共同表明，在涨停失败这类典型短线场景中，社交热度、传闻热度、盘口不平衡和流动性收缩能够在价格大幅下跌前形成可观测信号，为 Hermes Agent 学习风险识别提供了有效样本。&lt;/p&gt;
&lt;h1&gt;参考文献&lt;/h1&gt;
&lt;ol&gt;
&lt;li&gt;De Long, J. Bradford and Shleifer, Andrei and Summers, Lawrence H. and Waldmann, Robert J. (1990). Noise Trader Risk in Financial Markets. &lt;em&gt;Journal of Political Economy&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Bikhchandani, Sushil and Hirshleifer, David and Welch, Ivo (1992). A Theory of Fads, Fashion, Custom, and Cultural Change as Informational Cascades. &lt;em&gt;Journal of Political Economy&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Hong, Harrison and Stein, Jeremy C. (1999). A Unified Theory of Underreaction, Momentum Trading, and Overreaction in Asset Markets. &lt;em&gt;The Journal of Finance&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Lux, Thomas and Marchesi, Michele (1999). Scaling and Criticality in a Stochastic Multi-Agent Model of a Financial Market. &lt;em&gt;Nature&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;LeBaron, Blake and Arthur, W. Brian and Palmer, Richard (1999). Time Series Properties of an Artificial Stock Market. &lt;em&gt;Journal of Economic Dynamics and Control&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Hirshleifer, David and Teoh, Siew Hong (2003). Herd Behaviour and Cascading in Capital Markets: A Review and Synthesis. &lt;em&gt;European Financial Management&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Hong, Harrison and Kubik, Jeffrey D. and Stein, Jeremy C. (2004). Social Interaction and Stock-Market Participation. &lt;em&gt;The Journal of Finance&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Adomavicius, Gediminas and Tuzhilin, Alexander (2005). Toward the Next Generation of Recommender Systems: A Survey of the State-of-the-Art and Possible Extensions. &lt;em&gt;IEEE Transactions on Knowledge and Data Engineering&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Baker, Malcolm and Wurgler, Jeffrey (2006). Investor Sentiment and the Cross-Section of Stock Returns. &lt;em&gt;The Journal of Finance&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Tetlock, Paul C. (2007). Giving Content to Investor Sentiment: The Role of Media in the Stock Market. &lt;em&gt;The Journal of Finance&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Barber, Brad M. and Odean, Terrance (2008). All That Glitters: The Effect of Attention and News on the Buying Behavior of Individual and Institutional Investors. &lt;em&gt;The Review of Financial Studies&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Farmer, J. Doyne and Foley, Duncan (2009). The Economy Needs Agent-Based Modelling. &lt;em&gt;Nature&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Centola, Damon (2010). The Spread of Behavior in an Online Social Network Experiment. &lt;em&gt;Science&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Loughran, Tim and McDonald, Bill (2011). When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. &lt;em&gt;The Journal of Finance&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Kramer, Adam D. I. and Guillory, Jamie E. and Hancock, Jeffrey T. (2014). Experimental Evidence of Massive-Scale Emotional Contagion through Social Networks. &lt;em&gt;Proceedings of the National Academy of Sciences&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Da, Zhi and Engelberg, Joseph and Gao, Pengjie (2015). The Sum of All FEARS Investor Sentiment and Asset Prices. &lt;em&gt;The Review of Financial Studies&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Chen, Ting and Gao, Zhenyu and He, Jibao and Jiang, Wenxi and Xiong, Wei (2019). Daily Price Limits and Destructive Market Behavior. &lt;em&gt;Journal of Econometrics&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Leippold, Markus and Wang, Qian and Zhou, Wenyu (2022). Machine Learning in the Chinese Stock Market. &lt;em&gt;Journal of Financial Economics&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Covington, Paul and Adams, Jay and Sargin, Emre (2016). Deep Neural Networks for YouTube Recommendations. &lt;em&gt;Proceedings of the 10th ACM Conference on Recommender Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Park, Joon Sung and O&apos;Brien, Joseph C. and Cai, Carrie J. and Morris, Meredith Ringel and Liang, Percy and Bernstein, Michael S. (2023). Generative Agents: Interactive Simulacra of Human Behavior. &lt;em&gt;Proceedings of the 36th Annual ACM Symposium on User Interface Software and Technology&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yang, Y. and Gong, Z. and Huang, W. and Yang, Q. and Zhou, Z. and Huang, Z. and Li, Y. and Gao, X. and Dai, Q. and Liu, B. and Qiu, K. and Yang, Y. and Chen, D. and Yang, X. and Luo, C. (2026). SkillOpt: Executive Strategy for Self-Evolving Agent Skills.&lt;/li&gt;
&lt;li&gt;{alchaincyf} (2026). Darwin.SKILL: A System for Self-Evolving Agent Skills. &lt;a href=&quot;https://github.com/alchaincyf/darwin-skill&quot;&gt;链接&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
</content:encoded></item><item><title>当模型“看见但不理解”：多模态视觉推理可靠性问题综述</title><link>https://www.whalefall.top/posts/multimodal-visual-reasoning-reliability-survey/</link><guid isPermaLink="true">https://www.whalefall.top/posts/multimodal-visual-reasoning-reliability-survey/</guid><description>围绕感知、定位、推理、验证与纠错闭环，系统梳理多模态视觉推理的可靠性问题、代表方法与评测基准。</description><pubDate>Fri, 31 Jul 2026 00:00:00 GMT</pubDate><content:encoded>&lt;blockquote&gt;
&lt;p&gt;作者：刘勇杰（42311102）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;摘要&lt;/h2&gt;
&lt;p&gt;多模态大模型已从图像描述和视觉问答扩展到多图、视频、3D、像素级理解、长链推理和统一理解与生成。然而，模型“能够回答”并不等于“真正看懂并可靠推理”。本文围绕感知（Perception）、定位（Grounding）、推理（Reasoning）、验证（Verification）和纠错（Correction）构建 PGRVC 闭环，系统梳理视觉证据进入语言推理空间时的主要可靠性问题、代表性方法和评测基准，并讨论多模态幻觉、证据忠实性、过程监督、鲁棒性与主动视觉推理等开放问题。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;关键词：&lt;/strong&gt; 多模态大模型；视觉推理；视觉定位；多模态幻觉；过程监督；可靠性&lt;/p&gt;
&lt;h1&gt;引言&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;表 1　代表性综述与本文定位比较&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;综述&lt;/th&gt;
&lt;th&gt;年份&lt;/th&gt;
&lt;th&gt;主要对象&lt;/th&gt;
&lt;th&gt;分类主线&lt;/th&gt;
&lt;th&gt;与本文的关系&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Multimodal ML Survey&lt;/td&gt;
&lt;td&gt;2019&lt;/td&gt;
&lt;td&gt;多模态机器学习&lt;/td&gt;
&lt;td&gt;表示、翻译、对齐、融合、协同学习&lt;/td&gt;
&lt;td&gt;建立经典任务分类，但主要形成于现代MLLM之前。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Unified MUG Survey&lt;/td&gt;
&lt;td&gt;2025&lt;/td&gt;
&lt;td&gt;理解与生成统一模型&lt;/td&gt;
&lt;td&gt;架构、tokenizer、训练目标&lt;/td&gt;
&lt;td&gt;梳理统一理解与生成范式，但可靠推理不是主线。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MMR Survey&lt;/td&gt;
&lt;td&gt;2025&lt;/td&gt;
&lt;td&gt;多模态数学推理&lt;/td&gt;
&lt;td&gt;感知、对齐、推理&lt;/td&gt;
&lt;td&gt;提供PAR框架，但主要面向数学推理任务。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;本文&lt;/td&gt;
&lt;td&gt;2026&lt;/td&gt;
&lt;td&gt;可靠多模态视觉推理&lt;/td&gt;
&lt;td&gt;PGRVC闭环与可靠性评测&lt;/td&gt;
&lt;td&gt;围绕视觉证据、推理过程和纠错机制组织可靠性综述。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:pgrv&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/pgrv-framework.png&quot; alt=&quot;&quot; /&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figcaption&amp;gt;PGRVC闭环分析框架。验证与纠错把错误信号反馈到感知、Grounding和推理阶段，使视觉证据、推理过程与最终答案形成可检查的闭环。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;图像描述模型将卷积视觉特征映射为自然语言句子，证明视觉到语言生成可以通过端到端神经网络学习。随后，视觉–语义嵌入和区域级图文对齐把视觉类别、图像区域和语言片段置于同一语义空间。CLIP进一步用大规模自然语言监督学习可迁移视觉表示，ALBEF则强调在跨模态融合前先建立图文对齐。在大语言模型成为通用推理接口之后，Flamingo、BLIP和BLIP-2等工作把冻结视觉编码器、连接模块和语言模型组合起来，使模型能够处理交错图文输入并进行开放式回答。&lt;/p&gt;
&lt;p&gt;然而，多模态视觉推理的可靠性并没有随模型规模自动解决。首先，视觉编码器或token压缩可能遗漏小目标、细粒度属性、深度关系、运动方向和事件边界。其次，全局图文对齐并不保证对象、属性和关系在区域或像素层面绑定正确，绑定错误会在问答和推理链中被放大。再次，模型在视觉证据与文本提示冲突时可能更相信文本先验，在长链推理中可能生成视觉上不成立的中间步骤。最后，许多基准只检查最终答案，无法区分答案偶然正确、证据错误、过程错误和鲁棒性不足。&lt;/p&gt;
&lt;p&gt;已有综述各有重点。Multimodal Machine Learning从表示、翻译、对齐、融合和协同学习角度提供了经典分类，但其主要形成于现代MLLM之前。统一多模态理解与生成综述关注理解模型和生成模型在架构、tokenizer和训练目标上的统一趋势，但可靠推理不是主线。多模态数学推理综述围绕数学题中的感知、对齐和推理组织文献，为过程验证提供启发，但覆盖的视觉输入和可靠性问题相对集中。本文不同于这些综述：我们不按年份罗列模型，也不泛泛介绍所有多模态大模型，而是围绕可靠视觉推理构建闭环分析框架，分析视觉证据如何被提取、绑定、推理、验证并修正。&lt;/p&gt;
&lt;p&gt;本文贡献如下。第一，构建PGRVC分析框架，将Perception、Grounding、Reasoning、Verification和Correction作为可靠视觉推理的五个阶段，强调可靠性来自证据、绑定、推理、验证和纠错的协同，而不是单一模型规模。第二，按证据形式、作用阶段、监督信号、验证机制和典型失效模式组织代表性工作，覆盖视觉token、结构化感知、视频时空理解、区域/像素级定位、多步推理、过程奖励和幻觉缓解。第三，将评测体系整理为Answer、Evidence、Process和Executability四级验证对象，并把Robustness作为横向鲁棒性维度，避免用单一准确率概括复杂可靠性问题。&lt;/p&gt;
&lt;h1&gt;基础概念与发展脉络&lt;/h1&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:timeline&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/timeline.png&quot; alt=&quot;&quot; /&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figcaption&amp;gt;2011–2025年多模态视觉推理的发展脉络。早期工作侧重表示学习和图文对齐，后续模型逐步转向统一架构、长链推理和可靠性验证。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:arch&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/architecture-evolution.png&quot; alt=&quot;&quot; /&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figcaption&amp;gt;多模态模型架构从双编码器、对齐后融合和连接器接口，逐步演进到多编码器、统一tokenizer以及多图、视频和3D输入。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:ar-diffusion-encoding&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/ar_diffusion_encoding_original.png&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;统一多模态理解与生成模型中的像素、语义、查询和混合编码范式，根据文献[12]整理。不同编码路径决定了视觉证据进入语言推理空间的粒度和损失边界。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:unified-roadmap&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/unified_models_original.png&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;公开与非公开统一多模态模型的发布时间线，根据文献[12]整理。模型发布节奏显示，理解、生成和多输入形态正在向同一视觉语言接口汇聚。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;h2&gt;文献检索与筛选标准&lt;/h2&gt;
&lt;p&gt;本文检索CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR、ACL/EMNLP及TPAMI等主要来源，重点覆盖2023–2025年多模态视觉推理、视觉grounding、幻觉检测、过程验证和纠错方法；对于统一多模态基础架构，适当追溯至2011–2022年的代表性工作。纳入标准包括：研究对象与视觉证据、跨模态绑定、推理过程、验证机制或纠错机制直接相关；方法或基准能够解释可靠性问题的来源；实验对象覆盖图像、视频、多图、3D、文档图表或像素级输入之一。排除标准包括：仅报告通用模型发布而缺少可靠性分析、仅关注纯文本推理、或与视觉证据链无直接关系。基于上述标准，本文最终纳入59篇代表性文献，并按PGRVC阶段而非发表年份组织讨论。&lt;/p&gt;
&lt;h2&gt;可靠视觉推理的形式化定义&lt;/h2&gt;
&lt;p&gt;给定视觉输入$x$和问题$q$，多模态模型可被表示为输出三元组
$
\mathcal{M}(x,q)=(\hat{y},\hat{E},\hat{R}),
$
其中$\hat{y}$为最终答案，$\hat{E}$为模型显式或隐式依赖的视觉证据，$\hat{R}$为可读或可复核的推理过程。可靠性不仅要求$\hat{y}=y^{&lt;em&gt;}$，还要求$\hat{E}\approx E^{&lt;/em&gt;}$、$\hat{R}\vDash\hat{E}$且$\hat{R}\Rightarrow\hat{y}$，即答案正确、证据定位正确、推理过程与证据一致，并且过程能够推出答案。需要注意的是，可读的思维链并不必然等于模型内部真实计算路径，因此过程级评测还应检查关键证据被删除、替换或扰动后，答案和中间结论是否发生相应变化。&lt;/p&gt;
&lt;h2&gt;从多模态表示到连接器接口&lt;/h2&gt;
&lt;p&gt;早期研究回答的是如何学习跨模态共享表示。Multimodal Deep Learning证明多模态训练可以提升单模态特征质量，DeViSE将视觉类别映射到文本语义空间以支持开放类别泛化，Deep Visual-Semantic Alignments把全局类别推进到区域与句子片段对齐，Show and Tell则建立了视觉编码器到语言解码器的生成范式。随后，CLIP以大规模自然语言监督学习可迁移视觉表示，ALBEF强调先对齐后融合，Flamingo、BLIP和BLIP-2进一步通过连接模块（connector）把冻结视觉编码器接入LLM。这些工作构成现代MLLM的基础，但它们主要优化全局语义对齐和开放式生成，并不保证区域、对象、像素、深度或时间证据被忠实传入语言推理空间。&lt;/p&gt;
&lt;h2&gt;可靠性问题前移&lt;/h2&gt;
&lt;p&gt;近期模型把可靠性问题前移到数据、视觉表示和计算结构，而不是只在语言推理端补救。数据侧，Molmo/PixMo用高质量描述、自由问答和2D指点数据增强可观察证据，MM1.5系统分析OCR、合成描述和视觉指令数据对不同能力的影响。表示侧，TokenFlow试图在统一tokenizer中兼顾语义和像素信息，Eagle通过多视觉编码器组合扩大视觉前端覆盖范围。输入形态侧，LLaVA-Interleave和UniVLG分别处理多图、视频、3D交错输入和2D到3D grounding迁移。系统侧，LV-XAttn降低长视觉输入的cross-attention通信开销。这些路线共同说明，视觉证据在进入推理之前已经被数据分布、tokenizer、connector和计算预算筛选；一旦对象、位置或时序信息在接口处丢失，后续LLM很难仅凭语言推理恢复。&lt;/p&gt;
&lt;h1&gt;视觉感知：模型看到了什么&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;表 2　2025 年代表性工作的 PGRVC 定位与可靠性维度&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;PGRVC阶段&lt;/th&gt;
&lt;th&gt;代表工作&lt;/th&gt;
&lt;th&gt;证据粒度&lt;/th&gt;
&lt;th&gt;监督/成本&lt;/th&gt;
&lt;th&gt;验证或纠错信号&lt;/th&gt;
&lt;th&gt;主要失效边界&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Perception&lt;/td&gt;
&lt;td&gt;Molmo/PixMo; TokenFlow; Eagle; SSR&lt;/td&gt;
&lt;td&gt;描述、深度、visual token&lt;/td&gt;
&lt;td&gt;数据/结构成本较高&lt;/td&gt;
&lt;td&gt;可观察证据覆盖度&lt;/td&gt;
&lt;td&gt;小目标、低频事件和深度关系仍易丢失。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Grounding&lt;/td&gt;
&lt;td&gt;TCRT; Few Heads; ROD-MLLM; UniPixel&lt;/td&gt;
&lt;td&gt;区域、对象、mask、像素&lt;/td&gt;
&lt;td&gt;需要定位监督或诊断&lt;/td&gt;
&lt;td&gt;区域匹配、注意力、mask一致性&lt;/td&gt;
&lt;td&gt;全局对齐正确时仍可能局部绑定错误。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Reasoning&lt;/td&gt;
&lt;td&gt;GFlowVLM; Insight-V; OpenVLThinker; VideoChat-R1.5&lt;/td&gt;
&lt;td&gt;图像/视频证据与CoT&lt;/td&gt;
&lt;td&gt;SFT/RL或测试时搜索&lt;/td&gt;
&lt;td&gt;路径得分、过程奖励、答案一致性&lt;/td&gt;
&lt;td&gt;推理文本可读但未必真实依赖视觉证据。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Verification&lt;/td&gt;
&lt;td&gt;MME-CoT; MIRAGE; TOMATO; PhysBench&lt;/td&gt;
&lt;td&gt;答案、证据、过程、规则&lt;/td&gt;
&lt;td&gt;评测或验证器成本&lt;/td&gt;
&lt;td&gt;过程质量、帧序敏感性、物理约束&lt;/td&gt;
&lt;td&gt;验证器可能继承语言先验或缺少视觉观察。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Correction&lt;/td&gt;
&lt;td&gt;DPO; ClearSight; Nullu; Hidden Life; Critic-V&lt;/td&gt;
&lt;td&gt;偏好、视觉强度、logits、反馈&lt;/td&gt;
&lt;td&gt;训练或推理额外成本&lt;/td&gt;
&lt;td&gt;偏好反馈、视觉增强、critic信号&lt;/td&gt;
&lt;td&gt;无外部反馈时可能自我强化错误。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;局部细节与全局上下文&lt;/h2&gt;
&lt;p&gt;研究问题是模型如何同时保留任务相关细节和全局语义。Local-to-Global Attention指出，随机裁剪等增强可能引入背景噪声或使模型过度关注局部细节，因此用注意力引导的裁剪和特征选择补充全局上下文。What’s in the Image?从模型内部分析VLM如何在查询token、层和注意力头中保存图像信息，说明“模型看到了什么”需要通过内部表征诊断而非只看最终回答。Molmo/PixMo则从数据侧补足感知，使用高质量图像描述和2D pointing数据帮助模型建立更细的视觉观察能力。&lt;/p&gt;
&lt;p&gt;这三类方法分别对应输入选择、内部诊断和数据构建。Local-to-Global Attention不改变基础VLM，而是改变视觉信息选择方式；What’s in the Image?不直接提高模型，而是揭示视觉信息在模型内部的存储机制；Molmo/PixMo通过数据覆盖提升模型可见证据的质量。局限在于，注意力选择可能错过低显著但关键的证据，内部诊断结论可能随模型结构变化，高质量数据也难以覆盖所有细粒度关系。&lt;/p&gt;
&lt;h2&gt;结构化视觉感知&lt;/h2&gt;
&lt;p&gt;可靠推理需要的不只是图像token，还包括对象、深度、空间结构和像素级信息。Perception Tokens把深度图、检测框等中间视觉结果转化为模型可生成和使用的辅助token，使视觉感知结果成为类似思维链的中间证据。SSR将深度信息转化为结构化rationale，再蒸馏为可接入VLM的latent embedding，用于增强空间推理。UniPixel把对象指代、分割和像素级视觉推理统一起来，补足整体图像理解模型缺少像素对齐的问题。Visual Structures Help Visual Reasoning则指出LVLM常受binding problem限制，通过在视觉输入中加入低层空间结构并配合顺序解析提示，帮助模型把视觉特征绑定到正确对象。&lt;/p&gt;
&lt;p&gt;这些方法的共同点是显式结构化视觉证据。差异在于Perception Tokens和SSR引入可推理的中间表示，UniPixel把输出粒度推进到像素级，VISER则通过输入结构而非训练新模型来改善绑定。它们说明结构化视觉信息能够改善后续推理，但也带来新的问题：结构来自外部工具、训练监督或输入改造时，结构本身的错误会成为后续推理的上游噪声。&lt;/p&gt;
&lt;h2&gt;视频时空感知&lt;/h2&gt;
&lt;p&gt;视频推理的难点不只是输入更长，而是证据具有时间位置、对象身份和运动关系三种约束。现有方法大致对应三种处理方式。第一类显式保留时空位置，例如LLaVA-ST用语言对齐的位置嵌入和Spatial-Temporal Packer组织细粒度空间–时间信息，DTOS用专门token表示事件边界和目标位置，用文本引导clip sampler降低关键片段漏采样风险。第二类先建立跨帧对象关联，再把关联结果作为推理证据；Coarse Correspondences使用跟踪模型提取帧间或视角间对象粗对应，优点是不必改动MLLM，局限是依赖外部跟踪质量。第三类控制进入上下文的证据量，BOLT在长视频中选择与查询相关的帧，PAVE则通过轻量patch让Video-LLM利用音频、3D cues或多视角视频等侧通道信息。MotionBench的意义在于补上评测侧约束：如果基准不能区分运动方向、动态变化和静态场景线索，模型的“视频理解”容易被高估。&lt;/p&gt;
&lt;p&gt;因此，视频可靠性应从三个问题评价：关键帧是否被选中，对象身份是否跨帧保持，运动或事件关系是否真正参与答案。不同方法的训练成本并不等价，BOLT和Coarse Correspondences更接近推理时证据选择或外部提示，LLaVA-ST、PAVE和DTOS需要更明确的模型适配或任务训练。共同边界也更清楚：所有方法都要压缩视频证据，长视频中的低频事件、遮挡对象和跨片段因果关系仍可能在进入LLM之前丢失。&lt;/p&gt;
&lt;h2&gt;多图和三维感知&lt;/h2&gt;
&lt;p&gt;多图和3D输入要求模型跨视角整合证据。LLaVA-Interleave通过交错视觉指令调优把多图、多帧视频和多视角3D放进统一模型。MMIE把图文交错理解扩展到多图、视频和3D场景，暴露模型在复杂交错上下文中的不足。Thinking in Space用VSI-Bench评估模型能否从连续视频观察中形成空间记忆并回答空间问题。UniVLG则通过共享语言条件mask decoder和2D-to-3D lifting，将2D视觉语言模型迁移到3D grounding。&lt;/p&gt;
&lt;p&gt;四者的差异在于：LLaVA-Interleave重在统一输入形式，MMIE重在评测复杂交错理解，Thinking in Space重在空间记忆和召回，UniVLG重在2D/3D grounding结构。多图和3D推理的难点不是简单增加图像数量，而是如何维持跨视角对象身份、空间关系和尺度一致性。&lt;/p&gt;
&lt;h1&gt;视觉定位与跨模态绑定&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;表 3　感知与 Grounding 方法比较&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;视觉表示&lt;/th&gt;
&lt;th&gt;结构形式&lt;/th&gt;
&lt;th&gt;PGRVC阶段&lt;/th&gt;
&lt;th&gt;核心贡献&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Perception Tokens&lt;/td&gt;
&lt;td&gt;深度/检测token&lt;/td&gt;
&lt;td&gt;显式中间表征&lt;/td&gt;
&lt;td&gt;Perception + Reasoning&lt;/td&gt;
&lt;td&gt;将视觉结构转化为可生成、可引用的证据。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SSR&lt;/td&gt;
&lt;td&gt;深度rationale/latent&lt;/td&gt;
&lt;td&gt;深度理据&lt;/td&gt;
&lt;td&gt;Perception + Reasoning&lt;/td&gt;
&lt;td&gt;用深度信息增强空间推理。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VISER&lt;/td&gt;
&lt;td&gt;低层空间结构&lt;/td&gt;
&lt;td&gt;输入结构化&lt;/td&gt;
&lt;td&gt;Grounding + Reasoning&lt;/td&gt;
&lt;td&gt;通过顺序解析缓解对象绑定错误。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TCRT&lt;/td&gt;
&lt;td&gt;文本相关视觉特征&lt;/td&gt;
&lt;td&gt;跨模态精炼&lt;/td&gt;
&lt;td&gt;Grounding&lt;/td&gt;
&lt;td&gt;按任务语义选择相关视觉证据。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Few Attention Heads&lt;/td&gt;
&lt;td&gt;注意力图&lt;/td&gt;
&lt;td&gt;隐式定位头&lt;/td&gt;
&lt;td&gt;Grounding&lt;/td&gt;
&lt;td&gt;在冻结模型中定位少量关键注意力头。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;UniPixel&lt;/td&gt;
&lt;td&gt;mask/像素对齐&lt;/td&gt;
&lt;td&gt;像素级表征&lt;/td&gt;
&lt;td&gt;Grounding + Reasoning&lt;/td&gt;
&lt;td&gt;统一指代、分割和像素级视觉推理。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;视觉Token与语言模型接口&lt;/h2&gt;
&lt;p&gt;视觉token与LLM接口决定证据能否进入推理空间。CLIP式双编码器适合全局对齐，但缺少token级交互。ALBEF在对齐后引入跨模态融合。BLIP-2的Q-Former通过少量查询token从冻结视觉编码器提取信息，Flamingo用Perceiver Resampler和跨注意力处理交错视觉输入。从统一理解模型的架构归纳看，Connector大致可分为三类：projection-based接口用MLP或线性投影压缩视觉特征，query-based接口用可学习查询从视觉编码器中抽取证据，fusion-based接口在语言模型内部通过跨注意力或多头注意力融合视觉信息。2025年的TokenFlow、多编码器Eagle和LV-XAttn分别从统一tokenizer、多视觉前端和长视觉cross-attention角度扩展接口。&lt;/p&gt;
&lt;p&gt;接口设计的根本权衡是压缩与忠实性。少量token降低计算成本，却可能抹去小目标和局部关系；更多视觉token保留证据，却增加上下文和显存负担。可靠推理因此要求接口不仅传递语义，还要保留可定位、可回溯、可验证的视觉证据。&lt;/p&gt;
&lt;h2&gt;区域级和像素级定位&lt;/h2&gt;
&lt;p&gt;区域级定位解决语言表达对应哪一块视觉区域的问题。TCRT利用LLM任务先验和跨模态特征精炼提升视觉grounding。Few Attention Heads发现冻结LVLM中少数attention heads已有定位能力，因此可通过文本到图像的注意力图实现训练无关grounding。ROD-MLLM把可靠目标检测引入MLLM，特别强调对不存在对象的拒识能力。UniPixel进一步把对象指代和分割统一到像素级视觉推理中。&lt;/p&gt;
&lt;p&gt;这些方法形成从区域框到像素mask、从监督训练到训练无关挖掘、从检测到拒识的谱系。TCRT和ROD-MLLM依赖任务数据和专门模块，Few Attention Heads成本低但受注意力质量限制，UniPixel粒度最细但需要更高标注和计算成本。它们共同表明，全局图文对齐良好并不意味着对象级或像素级grounding可靠。&lt;/p&gt;
&lt;h2&gt;视觉–语言绑定问题&lt;/h2&gt;
&lt;p&gt;绑定问题指模型无法稳定地把属性、关系或文本短语绑定到正确视觉对象。Words or Vision通过文本扰动发现VLM在图文冲突时可能过度相信文本，这意味着语言先验会干扰视觉绑定。VISER从输入结构入手，通过低层空间结构和顺序解析提示改善计数、视觉搜索和空间关系任务。Semantic Grounding Correction则研究模型是否能在无微调、无oracle反馈的条件下自我修正grounding错误。&lt;/p&gt;
&lt;p&gt;三者分别揭示绑定错误的来源、输入侧缓解方式和自我纠错可能性。它们也提醒：绑定可靠性不能只通过最终问答准确率衡量，而需要检查文本短语、视觉区域和推理步骤是否一致。&lt;/p&gt;
&lt;h1&gt;多模态视觉推理&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;表 4　推理、强化学习和测试时扩展方法比较&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;推理范式&lt;/th&gt;
&lt;th&gt;监督信号&lt;/th&gt;
&lt;th&gt;推理时机制&lt;/th&gt;
&lt;th&gt;核心贡献&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Insight-V&lt;/td&gt;
&lt;td&gt;长链视觉推理&lt;/td&gt;
&lt;td&gt;推理轨迹数据&lt;/td&gt;
&lt;td&gt;长链生成&lt;/td&gt;
&lt;td&gt;为复杂视觉任务构造更充分的思维链。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GFlowVLM&lt;/td&gt;
&lt;td&gt;多路径搜索&lt;/td&gt;
&lt;td&gt;GFlowNet奖励&lt;/td&gt;
&lt;td&gt;多样路径采样&lt;/td&gt;
&lt;td&gt;探索多解空间，避免单一路径坍缩。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLThinker&lt;/td&gt;
&lt;td&gt;迭代SFT—RL&lt;/td&gt;
&lt;td&gt;SFT与RL循环&lt;/td&gt;
&lt;td&gt;反思式推理&lt;/td&gt;
&lt;td&gt;通过训练循环优化复杂视觉语言推理。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Chain-of-Step&lt;/td&gt;
&lt;td&gt;步骤级推理&lt;/td&gt;
&lt;td&gt;过程奖励模型&lt;/td&gt;
&lt;td&gt;步骤质量评估&lt;/td&gt;
&lt;td&gt;将奖励粒度推进到中间推理步骤。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VideoChat-R1.5&lt;/td&gt;
&lt;td&gt;迭代感知&lt;/td&gt;
&lt;td&gt;时空监督RL&lt;/td&gt;
&lt;td&gt;动态区域聚焦&lt;/td&gt;
&lt;td&gt;在测试时重新分配视觉注意力。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BOLT&lt;/td&gt;
&lt;td&gt;长视频选择&lt;/td&gt;
&lt;td&gt;无训练&lt;/td&gt;
&lt;td&gt;查询相关采样&lt;/td&gt;
&lt;td&gt;从长视频中选择与问题相关的证据帧。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;直接推理与多模态思维链&lt;/h2&gt;
&lt;p&gt;直接生成答案容易掩盖视觉证据缺失，因此近年工作开始构造或评估多模态思维链。Insight-V关注长链视觉推理数据和训练流程，试图让MLLM在复杂任务中生成更充分的推理路径。MME-CoT从质量、鲁棒性和效率三个维度评估多模态CoT，覆盖数学、科学、OCR、逻辑、时空和一般场景。GFlowVLM用生成流网络鼓励多样化推理路径，而不是只优化单一最大回报轨迹。&lt;/p&gt;
&lt;p&gt;比较来看，Insight-V偏向数据和训练，MME-CoT偏向评测，GFlowVLM偏向搜索式训练目标。它们共同改变了“回答即推理”的假设，但仍面临过程真实性问题：模型生成的推理链可能语言上连贯，却未必对应真实视觉证据。&lt;/p&gt;
&lt;h2&gt;多路径搜索与强化学习&lt;/h2&gt;
&lt;p&gt;当视觉问题需要搜索、规划或逐步检查时，单一路径推理不足。GFlowVLM通过GFlowNet鼓励多路径解。OpenVLThinker提出SFT与RL交替：SFT先激活潜在推理行为，RL再优化复杂视觉语言推理。Chain-of-Step Reasoning把推理拆成步骤级单元，并用过程奖励模型评估中间步骤。VideoChat-R1.5把RL与时空监督结合，在测试时通过迭代感知逐步聚焦高置信区域。&lt;/p&gt;
&lt;p&gt;这些方法的关键差异在奖励粒度和视觉反馈位置。GFlowVLM关注多样路径分布，OpenVLThinker关注训练循环，Chain-of-Step关注步骤奖励，VideoChat-R1.5把感知本身放入推理迭代。开放问题是：奖励模型是否真正看懂图像，以及RL优化是否会把错误视觉启发固化为高奖励策略。&lt;/p&gt;
&lt;h2&gt;迭代感知与测试时扩展&lt;/h2&gt;
&lt;p&gt;迭代感知的核心思想是推理过程中可以重新观察。VideoChat-R1.5通过Visual Test-Time Scaling让模型在推理时逐步更新时空关注。BOLT虽然不做强化学习，但也在推理时选择相关帧，属于长视频证据选择的测试时扩展。Self-Reflective Tokens则让模型在知识型VQA中判断是否需要外部知识，从而触发额外检索或反思。&lt;/p&gt;
&lt;p&gt;这类方法把计算从训练阶段部分转移到推理阶段，适合长视频、多图或知识密集场景。局限是测试时扩展增加延迟和成本，且若第一次关注区域错误，后续迭代可能围绕错误证据不断强化。&lt;/p&gt;
&lt;h2&gt;专项推理能力&lt;/h2&gt;
&lt;p&gt;专项推理能力可以看作证据需求的不同组合。空间任务要求模型维护对象位置、深度和视角关系，Thinking in Space和SSR分别从空间记忆评测和深度rationale增强这一问题。时间任务要求模型证明答案依赖帧序和运动变化，TOMATO、MotionBench和VidHalluc分别从帧序敏感性、细粒度运动和时间幻觉侧面施压。物理、数学和科学任务进一步要求视觉证据进入符号或因果推理，PhysBench和EMMA分别代表物理世界理解与跨学科图文联合推理。多图、3D和像素级任务则强调跨输入一致性和局部证据可见性，MMIE、LLaVA-Interleave和UniPixel分别对应交错视觉输入、统一多视觉指令调优和像素级对齐。&lt;/p&gt;
&lt;p&gt;这些能力之间并非并列清单，而是存在误差传播关系：空间关系错误会改变物理判断，时间定位错误会诱发视频问答幻觉，像素级定位错误会污染对象属性和关系推理。因此，可靠视觉推理需要共享的证据表示和验证机制，而不是为每个任务单独报告一个准确率。&lt;/p&gt;
&lt;h1&gt;验证、纠错与鲁棒性&lt;/h1&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:error&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/error-propagation.png&quot; alt=&quot;&quot; /&amp;gt;&lt;/p&gt;
&lt;p&gt;&amp;lt;figcaption&amp;gt;可靠视觉推理中的错误传播与纠错路径。感知遗漏、绑定错误和关系错误会逐级放大为推理链幻觉，验证和纠错模块需要在中间阶段截断错误传播。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;表 5　幻觉检测、验证和纠错方法比较&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;目标问题&lt;/th&gt;
&lt;th&gt;验证信号&lt;/th&gt;
&lt;th&gt;干预位置&lt;/th&gt;
&lt;th&gt;核心贡献&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;MIRAGE&lt;/td&gt;
&lt;td&gt;推理链幻觉&lt;/td&gt;
&lt;td&gt;感知/推理隔离&lt;/td&gt;
&lt;td&gt;评测基准&lt;/td&gt;
&lt;td&gt;区分看错之后的错误和推理诱发幻觉。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VidHalluc&lt;/td&gt;
&lt;td&gt;视频时间幻觉&lt;/td&gt;
&lt;td&gt;动作、顺序、转场&lt;/td&gt;
&lt;td&gt;视频评测&lt;/td&gt;
&lt;td&gt;测量视频模型的时序幻觉。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DPO on-policy&lt;/td&gt;
&lt;td&gt;对象幻觉&lt;/td&gt;
&lt;td&gt;偏好对齐&lt;/td&gt;
&lt;td&gt;训练目标&lt;/td&gt;
&lt;td&gt;强调偏好数据需贴近参考策略。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;PerturboLLaVA&lt;/td&gt;
&lt;td&gt;描述幻觉&lt;/td&gt;
&lt;td&gt;视觉扰动&lt;/td&gt;
&lt;td&gt;训练数据&lt;/td&gt;
&lt;td&gt;降低模型对语言先验的依赖。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ClearSight&lt;/td&gt;
&lt;td&gt;对象幻觉&lt;/td&gt;
&lt;td&gt;视觉信号强度&lt;/td&gt;
&lt;td&gt;解码阶段&lt;/td&gt;
&lt;td&gt;在推理时增强视觉证据。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nullu&lt;/td&gt;
&lt;td&gt;对象幻觉&lt;/td&gt;
&lt;td&gt;HalluSpace&lt;/td&gt;
&lt;td&gt;表示空间&lt;/td&gt;
&lt;td&gt;通过子空间投影削弱幻觉特征。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Hidden Life/VISTA&lt;/td&gt;
&lt;td&gt;视觉信息衰减&lt;/td&gt;
&lt;td&gt;token logits&lt;/td&gt;
&lt;td&gt;推理阶段&lt;/td&gt;
&lt;td&gt;在logit层面引导视觉忠实token。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Critic-V&lt;/td&gt;
&lt;td&gt;推理错误&lt;/td&gt;
&lt;td&gt;Critic反馈&lt;/td&gt;
&lt;td&gt;推理链&lt;/td&gt;
&lt;td&gt;用独立批评器发现视觉理解和推理错误。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;错误类型与触发信号&lt;/h2&gt;
&lt;p&gt;本文将多模态幻觉分为四类，并把它们视为闭环纠错的触发信号。第一是感知诱发幻觉，即模型没有看到或误看视觉对象；PerturboLLaVA认为密集图像描述中的幻觉与模型过度依赖语言先验相关，并通过视觉扰动训练降低该依赖。第二是定位和绑定幻觉，即对象存在但属性、关系或短语绑定错误；Words or Vision和VISER分别从模态偏置和binding problem角度揭示该问题。第三是推理诱发幻觉，即感知正确但推理链出现逻辑或事实错误；MIRAGE专门构造这类情形以区分感知错误和推理错误。第四是视频时间幻觉，VidHalluc从动作、时间顺序和场景转移上评估视频MLLM幻觉。这四类错误分别对应重观察、重定位、重推理和时间一致性检查，因此能够把幻觉检测结果转化为PGRVC闭环中的反馈路径。&lt;/p&gt;
&lt;h2&gt;Verification：答案、证据与过程验证&lt;/h2&gt;
&lt;p&gt;最终答案正确不代表推理过程正确。Verification阶段需要同时检查答案是否正确、证据是否存在、推理步骤是否由证据支持。Critic-V把Reasoner和Critic拆开，由Critic检查视觉理解和推理路径中的错误。Chain-of-Step Reasoning把推理拆为步骤并使用过程奖励评估中间步骤。MME-CoT提供质量、鲁棒性和效率指标，避免只奖励更长的CoT。MIRAGE进一步指出，即便图像被正确感知，推理链仍可能出现幻觉。&lt;/p&gt;
&lt;p&gt;这些方法体现了从结果验证到过程验证的转移，但过程验证不能只检查文本是否流畅。语言模型生成的推理文本不一定等于模型内部真实计算路径，因此更可靠的验证应检查：删除被声称使用的视觉证据后答案是否变化，替换关键区域后中间结论是否相应改变，推理中提到的对象是否可以定位，以及中间结论能否由检测、OCR、分割、物理规则或程序工具复核。问题在于，验证器自身也可能缺少视觉证据或受语言先验影响，因此验证器应尽量具备独立视觉观察能力，而不是只检查文本推理链。&lt;/p&gt;
&lt;h2&gt;Correction：重观察、重定位与重推理&lt;/h2&gt;
&lt;p&gt;Correction阶段不是一般意义上的“减少幻觉”，而是把验证信号反馈到具体出错位置。若错误来自视觉遗漏，系统需要重观察或增强视觉信号；若错误来自短语与区域绑定，系统需要重定位；若错误来自证据组合或逻辑链，系统需要重推理。数据与偏好优化方面，DPO on-policy data指出偏好样本必须贴近参考策略，否则DPO对幻觉的缓解不稳定。视觉扰动训练方面，PerturboLLaVA通过扰动视觉信号训练模型减少语言先验依赖。视觉信号增强方面，ClearSight在推理时增强视觉证据，而不是简单压制语言先验。表示空间干预方面，Nullu识别HalluSpace并将特征投影到其零空间。Token logit引导方面，Hidden Life of Tokens发现视觉信息会在生成过程中衰减，并提出VISTA在logit层面引导视觉忠实token。Critic反馈方面，Critic-V用独立批评模块捕捉错误。自我纠错方面，Semantic Grounding Correction表明模型可通过合适提示迭代修正grounding错误。&lt;/p&gt;
&lt;p&gt;这些方法的差异在于是否需要训练、是否改变模型权重、是否依赖外部验证以及反馈回到哪个阶段。一个真正的闭环还需要停止条件：当验证分数高于阈值时接受答案；当证据不足时重观察；当绑定不一致时重定位；当逻辑不成立时重推理；当多轮修正后不确定性仍然存在时拒答。没有一种方法能覆盖全部幻觉来源：DPO依赖偏好数据，扰动训练依赖扰动设计，表示干预依赖子空间估计，Critic依赖自身视觉能力，自我纠错可能在无外部反馈时陷入错误循环。&lt;/p&gt;
&lt;h2&gt;时序一致性和鲁棒性&lt;/h2&gt;
&lt;p&gt;视频模型的可靠性还包括时间一致性。Video Temporal Consistency通过一系列探针检查模型的时间定位回答是否与初始grounding一致。TOMATO指出很多视频问题可以用单帧或乱序帧解决，因此需要多帧增益和帧序敏感性指标。SVLTA用合成视频情境控制时间分布和语言描述，测试视觉–语言时间对齐。VidHalluc则直接评估动作、时间序列和场景转移幻觉。&lt;/p&gt;
&lt;p&gt;这些评测共同说明：视频理解的准确率如果不控制帧序、事件边界和视觉差异，可能高估模型真正的时间推理能力。&lt;/p&gt;
&lt;h1&gt;数据集与评测&lt;/h1&gt;
&lt;p&gt;现有数据集已经覆盖从单图、多图、视频、3D、多视角、文档图表到像素级任务的多种视觉输入形态。不同输入形态对应的错误模式并不相同：静态图像更容易暴露对象、属性和空间关系错误，视频任务更强调帧序、事件边界和动作持续性，多视角与3D任务则要求模型在视角变化中保持空间记忆与证据一致性。单图和多图数据主要检验问答、描述、定位、跨图一致性与交错理解；视频和3D数据进一步引入时间顺序、运动、空间记忆和视角变换；图表、文档和视觉数学数据则强调OCR、符号推理和可执行计算。已有综述显示，FigureQA、DVQA、PlotQA、ChartQA、IconQA、TabMWP和MathVista等数据集已经提供了大量最终答案监督。因此，可靠视觉推理评测的主要瓶颈不再只是题目数量，而是缺少可定位视觉证据、过程级推理轨迹和可执行验证标注；数据集比较也应同时报告输入形态、证据粒度和复核协议。&lt;/p&gt;
&lt;p&gt;本文将相关基准按“四级验证对象+横向鲁棒性维度”重新组织。Answer-level检查最终答案，常用Accuracy、F1或Exact Match；Evidence-level检查区域、帧、对象、mask或深度证据，区别于方法层面的Grounding，强调证据是否可以被评测；Process-level检查每一步是否与视觉证据一致，不能只奖励更长或更流畅的CoT；Executability-level要求推理过程可由规则、程序、工具或人工协议复核；Robustness不是第五个递进层级，而是贯穿前四类对象的横向属性，用于评估扰动、模态冲突、帧序变化和反事实条件下的稳定性。按照这一视角，MMIE和VSI-Bench主要暴露输入组织与空间记忆问题，EMMA和MME-CoT关注复杂任务中的过程推理质量，MotionBench、TOMATO、SVLTA和VidHalluc约束时间证据与视频幻觉，PhysBench和MIRAGE分别检验物理理解与推理链幻觉。因此，benchmark选择不应只依据任务名称或总分，而应明确它主要检验答案、证据、过程、可执行复核还是鲁棒性。&lt;/p&gt;
&lt;p&gt;从实验设计角度看，这一划分也有助于避免平均分掩盖错误来源。若目标是发现感知遗漏，应优先选择带有区域、帧或对象证据的Evidence-level基准；若目标是验证长链推理是否忠实，应结合Process-level标注和关键证据删除；若目标是比较真实部署中的稳定性，则需报告扰动、模态冲突和帧序变化下的Robustness表现。这样才能把“答对了什么”和“为什么答对”区分开来。&lt;/p&gt;
&lt;p&gt;基于上述整理，Figure &amp;lt;a href=&quot;#fig:par-pgrv&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;fig:par-pgrv&quot;&amp;gt;[fig:par-pgrv]&amp;lt;/a&amp;gt;保留原有PAR分类图，用于说明现有多模态数学推理评测通常从“What to extract”“How to align”和“How to perform reasoning”三个问题组织任务；Table &amp;lt;a href=&quot;#tab:benchmark&quot; data-reference-type=&quot;ref&quot; data-reference=&quot;tab:benchmark&quot;&amp;gt;[tab:benchmark]&amp;lt;/a&amp;gt;进一步把代表性基准映射到答案、证据、过程、可执行复核和鲁棒性维度。图和表的作用不同：前者提供任务谱系的外部参照，后者给出本文可靠性视角下的横向比较。&lt;/p&gt;
&lt;p&gt;&amp;lt;figure id=&quot;fig:par-pgrv&quot;&amp;gt;
&amp;lt;img src=&quot;/report-assets/multimodal-visual-reasoning-reliability-survey/par_taxonomy_original.png&quot; alt=&quot;Perception–Alignment–Reasoning 分类框架&quot; /&amp;gt;
&amp;lt;figcaption&amp;gt;Perception–Alignment–Reasoning 分类框架。该框架为多模态数学推理评测提供任务组织方式，也为本文进一步区分 Evidence、Process、Executability 和 Robustness 提供参照。&amp;lt;/figcaption&amp;gt;
&amp;lt;/figure&amp;gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;表 6　代表性基准与可靠性评测维度（A/E/P/X/R 分别表示 Answer、Evidence、Process、Executability 和 Robustness；✓ 为主要覆盖，○ 为部分覆盖）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;A&lt;/th&gt;
&lt;th&gt;E&lt;/th&gt;
&lt;th&gt;P&lt;/th&gt;
&lt;th&gt;X&lt;/th&gt;
&lt;th&gt;R&lt;/th&gt;
&lt;th&gt;证据标注&lt;/th&gt;
&lt;th&gt;过程标注&lt;/th&gt;
&lt;th&gt;主要用途&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;MMIE&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;评测多图、视频、3D和文本交错输入下的组织与证据选择能力。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;EMMA&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;覆盖数学、物理、化学和代码等跨学科多模态推理，并关注任务复杂度。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MME-CoT&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;评估CoT质量、鲁棒性和效率，避免只用推理链长度衡量能力。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MotionBench&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;约束模型对细粒度运动、时间证据和动作变化的理解。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TOMATO&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;检查模型是否真正利用多帧增益、帧序信息和视觉差异。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;PhysBench&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;用物理属性、关系和动态约束评估可复核的视觉推理。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VidHalluc&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;直接测量动作、时间序列和场景转移中的视频幻觉。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SVLTA&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;通过可控合成视频隔离视觉—语言时间对齐和描述偏差。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VSI-Bench&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;评测连续观察后的空间记忆、路径更新和视觉召回能力。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MIRAGE&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;○&lt;/td&gt;
&lt;td&gt;部分&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;区分感知正确后的推理链幻觉与普通感知错误，定位错误来源。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1&gt;讨论与结论&lt;/h1&gt;
&lt;p&gt;多模态视觉推理的核心在于平衡视觉证据表达、推理可靠性和计算效率。隐式视觉token便于端到端训练，也便于复用大语言模型的推理能力，但其可解释性较弱。显式视觉结构更适合定位、验证和纠错，却依赖额外工具、监督信号或结构化预处理。一次性感知效率较高，但容易遗漏关键证据；迭代感知能够根据推理需求持续补充信息，但会增加token、显存和推理延迟。&lt;/p&gt;
&lt;p&gt;训练和推理机制也存在类似权衡。SFT主要用于学习高质量推理范式，强化学习和过程奖励可进一步优化复杂目标，测试时扩展则能够动态分配感知与推理计算。相比只约束最终答案的结果奖励，过程奖励更有利于提升推理可靠性，但前提是奖励模型或验证器能够真正理解视觉内容。内部自检成本较低，却可能继承模型自身的错误先验；外部工具验证更可控，但受到工具接口和工具可靠性的限制。&lt;/p&gt;
&lt;p&gt;因此，可靠的多模态视觉推理不仅取决于语言模型的推理能力，还取决于视觉证据是否完整、视觉与语言是否准确绑定，以及错误能否被有效发现和修正。基于这一判断，PGRVC闭环将系统划分为Perception、Grounding、Reasoning、Verification与Correction五个环节：Perception决定可用证据的上限，Grounding保证视觉证据能够被语言准确引用，Reasoning负责组织和组合证据，Verification用于发现错误，Correction则使系统能够从错误中恢复。&lt;/p&gt;
&lt;h1&gt;参考文献&lt;/h1&gt;
&lt;ol&gt;
&lt;li&gt;Ngiam et al. (2011). Multimodal Deep Learning. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Frome et al. (2013). DeViSE: A Deep Visual-Semantic Embedding Model. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Karpathy and Fei-Fei (2015). Deep Visual-Semantic Alignments for Generating Image Descriptions. &lt;em&gt;Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Vinyals et al. (2015). Show and Tell: A Neural Image Caption Generator. &lt;em&gt;Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Baltrusaitis et al. (2019). Multimodal Machine Learning: A Survey and Taxonomy. &lt;em&gt;IEEE TPAMI 2019&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Radford et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Li et al. (2021). Align before Fuse: Vision and Language Representation Learning with Momentum Distillation. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Alayrac et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Li et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Li et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yang et al. (2026). A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning. &lt;em&gt;arXiv preprint arXiv:2603.08291&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Zhang et al. (2025). Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities. &lt;em&gt;arXiv preprint arXiv:2505.02567&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Deitke et al. (2025). Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Qu et al. (2025). TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Liu et al. (2025). Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Kang et al. (2025). GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Bigverdi et al. (2025). Perception Tokens Enhance Visual Reasoning in Multimodal Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Li et al. (2025). LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Liu et al. (2025). PAVE: Patching and Adapting Video Large Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Liu et al. (2025). BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Hong et al. (2025). MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Li et al. (2025). VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Jung et al. (2025). On the Consistency of Video Large Language Models in Temporal Comprehension. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Du et al. (2025). SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Tian et al. (2025). DTOS: Dynamic Time Object Sensing with Large Multimodal Model. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Chen et al. (2025). Task-aware Cross-modal Feature Refinement Transformer with Large Language Models for Visual Grounding. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Kang et al. (2025). Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yin et al. (2025). ROD-MLLM: Towards More Reliable Object Detection in Multimodal Large Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yang et al. (2025). Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Kaduri et al. (2025). What&apos;s in the Image? A Deep-Dive into the Vision of Vision Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Deng et al. (2025). Words or Vision: Do Vision-Language Models Have Blind Faith in Text?. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Zhang et al. (2025). Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Dong et al. (2025). Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Cocchi et al. (2025). Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yang et al. (2025). Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yin et al. (2025). ClearSight: Visual Signal Enhancement for Object Hallucination Mitigation in Multimodal Large Language Models. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yang et al. (2025). Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Liao et al. (2025). Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?. &lt;em&gt;Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Xia et al. (2025). MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Zhang et al. (2025). Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference under Ambiguities. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Chow et al. (2025). PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Li et al. (2025). LLaVA-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Shi et al. (2025). Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Chen et al. (2025). PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Shangguan et al. (2025). TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Haotian Zhang et al. (2025). MM1.5: Methods, Analysis &amp;amp; Insights from Multimodal LLM Fine-tuning. &lt;em&gt;International Conference on Learning Representations&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Cai et al. (2025). From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Chang and Venkataraman (2025). LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Hao et al. (2025). Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Jain et al. (2025). Unifying 2D and 3D Vision-Language Understanding. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Jiang et al. (2025). MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Zhuowei Li et al. (2025). The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models Via Visual Information Steering. &lt;em&gt;Proceedings of the International Conference on Machine Learning&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Jin et al. (2025). Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Yan et al. (2025). VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Dong et al. (2025). MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Zhang et al. (2025). OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Liu et al. (2025). SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Zhao et al. (2025). UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;Izadi et al. (2025). Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs. &lt;em&gt;Advances in Neural Information Processing Systems&lt;/em&gt;.&lt;/li&gt;
&lt;/ol&gt;
</content:encoded></item><item><title>服务器上实验的相关优化策略</title><link>https://www.whalefall.top/posts/my-post/</link><guid isPermaLink="true">https://www.whalefall.top/posts/my-post/</guid><description>科研不仅仅是埋头苦干，你要有一定的前置经验才能事半功倍，不要让自己成为老黄牛，做一些真正有价值的事情！</description><pubDate>Tue, 28 Jul 2026 10:47:09 GMT</pubDate></item><item><title>如何在服务器上部署外置大脑？</title><link>https://www.whalefall.top/posts/2026-07-19-how-to-deploy-cc/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2026-07-19-how-to-deploy-cc/</guid><description>关于 如何提高科研效率</description><pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate></item><item><title>未来规划</title><link>https://www.whalefall.top/posts/2026-05-12-future-plan/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2026-05-12-future-plan/</guid><description>近期规划</description><pubDate>Tue, 12 May 2026 00:00:00 GMT</pubDate></item><item><title>动手学强化学习</title><link>https://www.whalefall.top/posts/2026-01-27-rl/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2026-01-27-rl/</guid><description>浅学一下，了解一下</description><pubDate>Tue, 27 Jan 2026 00:00:00 GMT</pubDate></item><item><title>Astro 的开始</title><link>https://www.whalefall.top/posts/astro-start/</link><guid isPermaLink="true">https://www.whalefall.top/posts/astro-start/</guid><description>Astro的开端</description><pubDate>Sat, 24 Jan 2026 00:00:00 GMT</pubDate></item><item><title>NLP--基础知识</title><link>https://www.whalefall.top/posts/2025-12-25-nlp/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-12-25-nlp/</guid><description>关于NLP的一些基础知识</description><pubDate>Thu, 25 Dec 2025 00:00:00 GMT</pubDate></item><item><title>贝叶斯 AND KNN</title><link>https://www.whalefall.top/posts/2025-11-12-knn-bayesi/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-11-12-knn-bayesi/</guid><description>解释一下统计学中的两个通用性模型</description><pubDate>Wed, 12 Nov 2025 00:00:00 GMT</pubDate></item><item><title>图论(算法)</title><link>https://www.whalefall.top/posts/2025-10-27-graph/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-10-27-graph/</guid><description>算法竞赛图相关知识</description><pubDate>Mon, 27 Oct 2025 00:00:00 GMT</pubDate></item><item><title>数学(算法)</title><link>https://www.whalefall.top/posts/2025-10-27-math/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-10-27-math/</guid><description>算法竞赛数学内容</description><pubDate>Mon, 27 Oct 2025 00:00:00 GMT</pubDate></item><item><title>为什么AI胡言乱语</title><link>https://www.whalefall.top/posts/2025-09-21-a-i/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-09-21-a-i/</guid><description>AI为什么胡言乱语?</description><pubDate>Sun, 21 Sep 2025 00:00:00 GMT</pubDate></item><item><title>数据结构(算法)</title><link>https://www.whalefall.top/posts/2025-09-21-alogrithm-structure/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-09-21-alogrithm-structure/</guid><description>我感觉将算法放到一个板子里面容易忘记自己学了什么,所以我以后单独开个专栏来记录算法知识点</description><pubDate>Sun, 21 Sep 2025 00:00:00 GMT</pubDate></item><item><title>最近</title><link>https://www.whalefall.top/posts/2025-09-18-last/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-09-18-last/</guid><description>最近忙🈵,没有时间去更新博客....</description><pubDate>Thu, 18 Sep 2025 00:00:00 GMT</pubDate></item><item><title>服务器:Time Out?</title><link>https://www.whalefall.top/posts/2025-0827-connect-error/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-0827-connect-error/</guid><description>由于有时候本地服务器难以连接一下国外网站的情况,我们可以通过一下流程解决 connect error,Time out的问题</description><pubDate>Wed, 27 Aug 2025 00:00:00 GMT</pubDate></item><item><title>GiT仓库管理</title><link>https://www.whalefall.top/posts/2025-08-26-git/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-08-26-git/</guid><description>针对于GIT进行仓库管理,一个很重要有意义的工具.(分布式管理工具)</description><pubDate>Tue, 26 Aug 2025 00:00:00 GMT</pubDate></item><item><title>秋</title><link>https://www.whalefall.top/posts/2025-08-07-autumn/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-08-07-autumn/</guid><description>立秋,有种落寞的孤寂,或许也是新的开始吧。</description><pubDate>Thu, 07 Aug 2025 00:00:00 GMT</pubDate></item><item><title>学习麻花</title><link>https://www.whalefall.top/posts/2025-08-05-four-popular-ai/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-08-05-four-popular-ai/</guid><description>在如今这个大语言泛滥的时代,很多基础能力都已经被AI所取代,随着AI的能力不断变强,很多人已经变得麻木,已经仅仅沉浸于享受调教AI的轻松感....</description><pubDate>Tue, 05 Aug 2025 00:00:00 GMT</pubDate></item><item><title>暑假闲事-基础技能</title><link>https://www.whalefall.top/posts/2025-08-03-basical-knowledge/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-08-03-basical-knowledge/</guid><description>本文是学习清华计算机科协的暑期课程--基础技能讲解</description><pubDate>Sun, 03 Aug 2025 00:00:00 GMT</pubDate></item><item><title>算法小记</title><link>https://www.whalefall.top/posts/2025-07-25-alogrithm-note/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-07-25-alogrithm-note/</guid><description>对最近的自己的一些问题的总结</description><pubDate>Fri, 25 Jul 2025 00:00:00 GMT</pubDate></item><item><title>科研思考2.0</title><link>https://www.whalefall.top/posts/2025-07-21-thingking2/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-07-21-thingking2/</guid><description>针对于精读论文存在的问题🤡</description><pubDate>Mon, 21 Jul 2025 00:00:00 GMT</pubDate></item><item><title>科研思考1.0</title><link>https://www.whalefall.top/posts/2025-07-16-thingking1/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-07-16-thingking1/</guid><description>关于看论文的一些心得</description><pubDate>Wed, 16 Jul 2025 00:00:00 GMT</pubDate></item><item><title>生成式对抗网络(GAN)--相关文献调研</title><link>https://www.whalefall.top/posts/2025-07-12-gan/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-07-12-gan/</guid><description>关于 生成式对抗网络的基础介绍 + 几种常见的扩展GAN</description><pubDate>Sat, 12 Jul 2025 00:00:00 GMT</pubDate></item><item><title>人工合成网络--相关文献调研</title><link>https://www.whalefall.top/posts/2025-07-09-network/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-07-09-network/</guid><description>相关人工合成网络的经典论文和一些常见的合成网络方法, 相关论文链接没有给出,可以自己在 google scholar中进行搜索😈</description><pubDate>Wed, 09 Jul 2025 00:00:00 GMT</pubDate></item><item><title>情绪传播机制--相关文献调研</title><link>https://www.whalefall.top/posts/2025-07-05-emotion-article/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-07-05-emotion-article/</guid><description>查找学习关于\&quot;人工网络中的情绪传播机制\&quot;，以下是两篇我阅读学习的文献 —— 精读的很烂，太浮躁了，没有脚踏实地地去读，如果内容有问题，请多包涵 :）</description><pubDate>Sat, 05 Jul 2025 00:00:00 GMT</pubDate></item><item><title>毛概复习(全面版)</title><link>https://www.whalefall.top/posts/2025-06-29-maozedong/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-06-29-maozedong/</guid><description>毛概书 1-4章,6-8章书本知识总结</description><pubDate>Sun, 29 Jun 2025 00:00:00 GMT</pubDate></item><item><title>操作系统笔记-王道考研</title><link>https://www.whalefall.top/posts/2025-0619-operationsystem/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-0619-operationsystem/</guid><description>关于王道考研2024-操作系统的笔记</description><pubDate>Thu, 19 Jun 2025 00:00:00 GMT</pubDate></item><item><title>基于YOLO的神经网络剪枝条</title><link>https://www.whalefall.top/posts/2025-06-14-yolo-basic/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-06-14-yolo-basic/</guid><description>基于YOLO的图像识别训练（英文手写体 + 生活中常见的事物（猫猫狗狗））</description><pubDate>Sat, 14 Jun 2025 00:00:00 GMT</pubDate></item><item><title>牛客赛</title><link>https://www.whalefall.top/posts/2025-06-10-on-time-nowcoder/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-06-10-on-time-nowcoder/</guid><description>统一记录牛客上的题目</description><pubDate>Tue, 10 Jun 2025 00:00:00 GMT</pubDate></item><item><title>算法笔记2.0</title><link>https://www.whalefall.top/posts/2025-05-16-alogrithm-note2/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-05-16-alogrithm-note2/</guid><description>本文章是 基于 左神课程 + 牛客课程 进行算法系统式学习的知识汇总。</description><pubDate>Fri, 16 May 2025 00:00:00 GMT</pubDate></item><item><title>文字的魅力</title><link>https://www.whalefall.top/posts/2025-04-30-beauty-of-chinese/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-04-30-beauty-of-chinese/</guid><description>关于文字的眼泪,今天突然听到“曾经志在四方少年，羡慕南飞的雁”.</description><pubDate>Wed, 30 Apr 2025 00:00:00 GMT</pubDate></item><item><title>Latex基础公式学习</title><link>https://www.whalefall.top/posts/2025-04-28-latex/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-04-28-latex/</guid><description>突然做笔记需要这个就做了一个简单的学习。</description><pubDate>Mon, 28 Apr 2025 00:00:00 GMT</pubDate></item><item><title>OrangePi5部署YOLO推理模型</title><link>https://www.whalefall.top/posts/2025-04-15-yolo-orangepi5/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-04-15-yolo-orangepi5/</guid><description>阐述一下我在 YOLO模型转化 和 开发板上配置踩的坑。 :（</description><pubDate>Tue, 15 Apr 2025 00:00:00 GMT</pubDate></item><item><title>数据库基础知识</title><link>https://www.whalefall.top/posts/2025-04-12-dataset/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-04-12-dataset/</guid><description>数据库的基本知识学习</description><pubDate>Sat, 12 Apr 2025 00:00:00 GMT</pubDate></item><item><title>开端</title><link>https://www.whalefall.top/posts/2025-03-25-start/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-03-25-start/</guid><description>这是一个博客的开端</description><pubDate>Tue, 25 Mar 2025 00:00:00 GMT</pubDate></item><item><title>算法笔记1.0</title><link>https://www.whalefall.top/posts/2025-03-25-old-alogrithm/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-03-25-old-alogrithm/</guid><description>Hello-World，算法学习的开始</description><pubDate>Tue, 25 Mar 2025 00:00:00 GMT</pubDate></item><item><title>Python算法学习--备战蓝桥杯</title><link>https://www.whalefall.top/posts/2025-03-24-python/</link><guid isPermaLink="true">https://www.whalefall.top/posts/2025-03-24-python/</guid><description>14天 PY 成神计划</description><pubDate>Mon, 24 Mar 2025 00:00:00 GMT</pubDate></item></channel></rss>