扔掉 Self-Attention 后的 EXAONE Financ

创业者小王 专家 18小时前 801 浏览 9 点赞 约 2 分钟

很多搞金融预测的人都被 Transformer 的计算量搞崩溃过,尤其是处理那种超长序列或者多通道数据时,内存占用简直是噩梦。LG 搞的这个 EXAONE Finance 走了一条很激进的路:直接把 Self-Attention 给砍了,换成了线性时间复杂度算子。这在目前追求“大而全”的注意力机制大环境下,反而出了个 SOTA(State-of-the-art),挺有意思。

金融时间序列最恶心的地方就在于它不是连续的,经常有缺失值,而且噪声极大。一般的通用时间序列模型(TSFM)在处理这些数据时,由于预训练语料不对口,经常会出现预测结果极其离谱的情况。EXAONE Finance 这次在预训练阶段就做了针对性优化,不仅涵盖了股票,还把外汇、大宗商品、加密货币、固定收益以及宏观经济指标全部塞进去了,这比单纯跑股价预测的模型要全面得多。

我看了一下它的架构,核心就在于用两个简单的算子替代了昂贵的注意力机制,解决了计算成本随序列长度平方级增长的问题:

一、时间维度混合(Temporal Mixing)
它用了一个因果 1D 卷积(Causal 1D Convolution)。简单来说,就是保证模型在预测当前点时,只能看到过去的数据,不会发生“时间泄露”。这种做法在处理长序列时比 Transformer 快得多,而且在捕捉局部趋势上非常稳。

二、变量维度混合(Variate Mixing)
它设计了一个组感知池化多层感知机(Group-aware Pooling MLP)。金融数据通常是多通道的(比如同时看几十个指标),这个 MLP 负责处理不同变量之间的关系,但它不是全连接,而是通过组池化来降低复杂度。

另外,它在训练里加了一个 Masked Context Augmentation(掩码上下文增强)。这招很实用,就是故意在训练数据里挖掉一段连续的区间,强迫模型在面对真实市场中常见的“数据缺失”时,依然能保持鲁棒性,而不是一遇到缺失值就直接崩溃或输出乱码。

在 FinVerse 这个涵盖多种资产类别的基准测试中,这个模型直接拿了第一,而且是全方位的碾压。具体的评估维度包括:

  • 点预测准确率(Point-forecast Accuracy): 预测具体数值的精准度更高。
  • 截面资产排名(Cross-sectional Asset Ranking): 在一堆资产里挑出谁涨得更多,这个能力对量化选股至关重要。
  • 投资组合获利能力(Portfolio Profitability): 最终转化成钱的能力,这是金融模型最硬的指标。

说实话,现在很多模型都在卷参数量,但 EXAONE Finance 证明了在特定垂直领域,通过精简架构(Attention-free)+ 领域专业语料,效果反而比强行套用通用大模型要好得多。如果你在做量化研究,不需要去死磕复杂的 Transformer 变体,这种基于线性算子的预测模型可能才是效率最高的方向。

这种去掉注意力机制的尝试让我想到最近很多线性 RNN 或 State Space Models (SSM) 的趋势,看来金融预测领域也开始意识到,对于纯数字序列,过度复杂的注意力机制其实性价比极低。

EXAONE FinanceLGFinVerseTime Series Forecasting

全部回复 (4)

独立开发者Leo 专家 18小时前
其实金融数据噪声太大了,砍掉attention说不定反而能防止过拟合。
0 回复
大Tom在路上 初级 18小时前
这思路有意思,不过要是把关键的上下文关联也给砍了,效果会掉吗?
0 回复
脚本小子阿杰 专家 18小时前
确实,之前跑长序列内存直接爆掉,线性复杂度确实省心多了。
0 回复
完美主义技术宅 专家 18小时前
这内存确实省了不少,但砍掉Attention后,对长程依赖的捕捉还稳吗?
0 回复

发表回复

支持 Markdown 格式