扔掉 Self-Attention 后的 EXAONE Financ
金融时间序列最恶心的地方就在于它不是连续的,经常有缺失值,而且噪声极大。一般的通用时间序列模型(TSFM)在处理这些数据时,由于预训练语料不对口,经常会出现预测结果极其离谱的情况。EXAONE Finance 这次在预训练阶段就做了针对性优化,不仅涵盖了股票,还把外汇、大宗商品、加密货币、固定收益以及宏观经济指标全部塞进去了,这比单纯跑股价预测的模型要全面得多。
我看了一下它的架构,核心就在于用两个简单的算子替代了昂贵的注意力机制,解决了计算成本随序列长度平方级增长的问题:
一、时间维度混合(Temporal Mixing)
它用了一个因果 1D 卷积(Causal 1D Convolution)。简单来说,就是保证模型在预测当前点时,只能看到过去的数据,不会发生“时间泄露”。这种做法在处理长序列时比 Transformer 快得多,而且在捕捉局部趋势上非常稳。
二、变量维度混合(Variate Mixing)
它设计了一个组感知池化多层感知机(Group-aware Pooling MLP)。金融数据通常是多通道的(比如同时看几十个指标),这个 MLP 负责处理不同变量之间的关系,但它不是全连接,而是通过组池化来降低复杂度。
另外,它在训练里加了一个 Masked Context Augmentation(掩码上下文增强)。这招很实用,就是故意在训练数据里挖掉一段连续的区间,强迫模型在面对真实市场中常见的“数据缺失”时,依然能保持鲁棒性,而不是一遇到缺失值就直接崩溃或输出乱码。
在 FinVerse 这个涵盖多种资产类别的基准测试中,这个模型直接拿了第一,而且是全方位的碾压。具体的评估维度包括:
- 点预测准确率(Point-forecast Accuracy): 预测具体数值的精准度更高。
- 截面资产排名(Cross-sectional Asset Ranking): 在一堆资产里挑出谁涨得更多,这个能力对量化选股至关重要。
- 投资组合获利能力(Portfolio Profitability): 最终转化成钱的能力,这是金融模型最硬的指标。
说实话,现在很多模型都在卷参数量,但 EXAONE Finance 证明了在特定垂直领域,通过精简架构(Attention-free)+ 领域专业语料,效果反而比强行套用通用大模型要好得多。如果你在做量化研究,不需要去死磕复杂的 Transformer 变体,这种基于线性算子的预测模型可能才是效率最高的方向。
这种去掉注意力机制的尝试让我想到最近很多线性 RNN 或 State Space Models (SSM) 的趋势,看来金融预测领域也开始意识到,对于纯数字序列,过度复杂的注意力机制其实性价比极低。