销量预测是连接预测科学理论与商业决策实践的关键纽带,也是检验预测方法论有效性的理想试验场。2025—2026年,销量预测领域正在经历一场多维度的范式变革。时间序列基础模型(TSFM)在零售场景中的系统性评估表明,其优势在概率预测指标上最为显著,而在点预测精度上与最优传统方法的差距远小于宣传所暗示;因果推断方法的深度嵌入使销量预测从“什么会卖掉”走向“为什么卖掉”和“怎样让它卖得更多”,从预测智能升级为处方智能;分层对账研究揭示了预测粒度与对账方法的交互效应,挑战了“全球模型必然优于局部模型”的简单假设。与此同时,间歇性需求预测领域的“特征工程优先于架构复杂性”原则,为深度学习狂热提供了一剂清醒剂。本文认为,销量预测科学的核心命题正在从“如何预测得更准”转向“如何构建可干预、可迁移、可解释的预测系统”,而这一转向面临四重深层张力:基础模型收益的边界条件、因果识别的内生性困境、分层一致性与预测精度的权衡、以及数据驱动与领域知识的平衡。
关键词:销量预测;时间序列基础模型;因果推断;分层对账;间歇性需求
一、引言
销量预测是预测科学中一个看似平凡却极其复杂的领域。它的“平凡”在于问题的朴素表述——明天/下周/下个月,某个商品/品类/门店能卖出多少;它的“复杂”在于这一朴素表述之下隐藏着多层结构:从商品到品类再到区域的总和层级、从日常销售到促销活动再到突发事件的周期模式、从单店单品到全渠道跨境的维度扩展、以及从确定性库存决策到风险感知调度的应用场景分化。
正是这种“表面朴素、内核复杂”的特征,使销量预测成为预测科学方法论演进的理想试验场。当基础模型展现出前所未有的零样本泛化能力时,第一个问题就是:它们在零售需求预测中的收益究竟有多大?当因果推断从学术边缘走向中心时,销量预测是它最具实践价值的应用场景之一。当分层预测面临“总和一致性与底层精度”的经典困境时,深度学习架构的引入是否带来了根本性的改变?
2025—2026年,这些问题的答案正在逐渐浮现。一篇PRISMA-informed的系统综述对543对比较进行了元回归分析,发现基础模型在零售需求预测中具有“稳健的基准级优势,在分布指标上最强,在点预测指标上较小”。因果方法从“预测销售”延伸到“量化促销增量”和“优化定价策略”,使预测直接服务于决策。分层预测研究则揭示了一个反直觉的发现:最优的“架构-对账”组合取决于层级深度——战略层适合PatchTST+MinTrace,运营层适合Transformer+Bottom-Up。
本文将从基础模型评估、因果预测、分层对账、间歇性需求、LLM融合五个维度,系统梳理销量预测领域的前沿进展,并在此基础上进行深度反思。
二、基础模型在销量预测中的真实收益
2.1 系统性评估揭示的收益边界
时间序列基础模型(TSFM)在过去两年中引发了零售预测领域的巨大期待。TimesFM-3拥有3.3亿参数,在逾1万亿个时间点数据上预训练,原生支持多变量预测,可联合处理促销计划、节假日等外部特征,单次前向传播即可生成完整预测。Chronos、Moirai、Lag-Llama等模型也纷纷宣称在零售基准上超越传统方法。
然而,一篇发表于2026年7月的系统综述和跨基准元分析提供了更为审慎的图景。研究者筛选了约150篇2020—2026年的论文,从fev-bench和GIFT-Eval中提取了超过800行定量结果,覆盖九个零售数据集。模型级元回归对543对比较的分析发现:基础模型的优势“最强在分布指标上,较小在点预测指标上”。
这一发现的方法论含义深远。它暗示基础模型的核心价值可能不在于“预测得更准”,而在于“预测得更全面”——即更好地捕捉需求的概率分布、尾部风险和不确定性区间。对于库存管理而言,概率预测的质量可能比点预测精度更为关键,因为安全库存、再订货点等决策直接依赖于需求分布的尾部特征。
综述还包含了面向实践者的成本-精度帕累托分析。这一分析框架的价值在于它承认了一个商业现实:基础模型的推理成本远高于传统方法,而精度增益可能无法覆盖成本差异。对于SKU数量以万计的大型零售商而言,将基础模型部署到所有SKU上可能在经济上不可行。更务实的策略可能是分层部署:对高价值SKU使用基础模型,对长尾SKU使用轻量级方法。
2.2 快消品场景中的实证发现
“When Time-Series Foundation Models Work for Quick-Commerce Demand Forecasting”一文从快消品场景切入,系统检验了基础模型的适用条件。研究发现,基础模型在以下条件下收益最显著:(1)历史数据极度稀缺的新品预测;(2)需求模式突变(如疫情期间)的适应性预测;(3)多变量协变场景下的联合预测。反之,在数据充足、模式稳定的成熟SKU上,精心调优的梯度提升树仍然具有竞争力。
这一发现与M5竞赛的经验形成了有趣的呼应。2020年M5竞赛的冠军解决方案并非Transformer或LSTM,而是基于LightGBM的梯度提升树。五年后,尽管基础模型架构发生了革命性变化,“简单仍然胜过花哨”的教训在零售预测中依然部分成立。
三、因果推断的深度嵌入:从预测到处方
3.1 促销ROI的因果量化
促销活动是零售销量预测中最具挑战性的问题之一:促销期间销量上升,但其中有多少是真正的增量(uplift),多少是从未来“借用”的需求?传统深度学习模型可以预测促销期间的销量,却无法回答这一因果问题,因为“它们无法区分有多少销量是真正增量的,也无法进行严格的反事实推理”。
一项2026年的研究提出了因果-处方方法论框架,整合了DirectLiNGAM因果发现、DoWhy/GCM因果推断和遗传算法优化。其核心创新是将因果模型用作遗传算法的适应度函数,搜索能够最大化预期ROI的促销配置。结果显示,因果模型实现了良好的ROI预测(R²=0.80),同时支持干预性和反事实查询,遗传算法利用这一能力提出的折扣、时长和机制组合“在多个随机种子下持续优于随机搜索和贪心搜索基线”。
这项工作的范式意义在于:它标志着销量预测从“预测智能”向“处方智能”的跃迁。模型不仅告诉零售商“促销期间会卖多少”,还告诉它们“应该怎样设计促销活动才能最大化回报”。
3.2 动态定价的因果引擎
LLM-DPECI框架代表了因果推断在定价决策中的前沿应用。该研究明确指出传统方法的局限:“短期需求预测系统无法区分真正的因果与巧合,可能导致不充分的定价措施和众所周知的价格下行螺旋”。LLM-DPECI整合了因果机器学习、贝叶斯优化和检索增强生成,使用DoWhy和CausalML通过双重机器学习估计异质性价格弹性,同时显式控制竞争对手定价、季节性事件和天气效应等混杂因素。在Instacart和Walmart M5公开数据集上的实验表明,该方法“在离线策略需求估计精度和收入提升方面显著优于基于相关性的基线”。
更值得关注的是其“人机接口”设计:基于GPT/Claude的RAG管线生成“易于理解的自然语言定价报告”,使非技术管理者能够“基于因果洞察采取行动”。这一设计回应了因果预测的一个核心实践挑战:即便模型发现了正确的因果效应,如果决策者无法理解这些效应,因果洞察的商业价值就无法实现。
3.3 Causal-XAI:透明性与因果性的融合
Causal-XAI框架将因果推断与可解释AI深度整合,使用双重机器学习识别真正的因果驱动因素,再用Causal Transformer将这些因果因素用于精确预测。研究明确指出,现有方法“不区分相关性与因果推断,无法提供底层推理信息,因此只产生销售预测而非可操作的定价或促销建议”。在Corporación Favorita数据集上的评估表明,该方法“不仅实现了更优的预测精度,还提供了直接导向商业行动的因果信息”。
Causal-XAI的方法论贡献在于它将“可解释性”从技术装饰提升为决策基础设施。SHAP值告诉分析师“哪个特征对预测贡献最大”,而因果-XAI告诉决策者“改变哪个因素能改变结果”——两者的实践价值截然不同。
3.4 因果聚类的产品分组策略
Ricklin的博士论文从另一个角度推进了因果方法在销量预测中的应用。其研究结构围绕三个渐进的方法论轴心展开:局部单变量模型、基于因果聚类的全局单变量模型、以及显式整合产品间交互的多变量模型。因果聚类的核心创新是“根据产品的共同驱动因素而非销售相似性来分组产品”。传统聚类方法将销售模式相似的产品归为一组,而因果聚类将受同一外部因素(如同一促销日历、同一竞品动态)驱动的产品归为一组——后者的分组逻辑更接近数据生成过程的真实结构。
四、分层预测与对账:粒度与一致性的张力
4.1 架构与对账方法的交互效应
零售预测的一个核心挑战是层级一致性:从总需求到门店-商品级别的预测必须在所有聚合层级上保持数学一致性,否则不同层级做出的库存和补货决策将相互冲突。
Gomes等人使用M5衍生数据集(42,840条序列)系统比较了三种MLP导向模型(MLP、N-BEATS、N-HiTS)和五种Transformer模型(Transformer、TFT、Informer、PatchTST、Autoformer)在分层预测中的表现,并测试了Bottom-Up和四种MinTrace对账变体。核心发现具有深刻的实践指导意义:最强的Transformer组合在每个层级都优于最强的MLP组合。但更关键的是,最优的“架构-对账”组合取决于层级深度——PatchTST+MinTrace-WLS-struct在聚合和中层最优(Total级MASE为0.537),而在产品-门店级,Bottom-Up对账变得更为可取,Transformer达到了最低的MASE(1.367)。
这一发现的方法论含义是:架构选择和对账方法选择不应独立于层级深度和预测目标。战略层(总需求预测)适合自顶向下的对账策略,因为聚合数据信噪比高,MinTrace能够有效利用层级间的相关性;运营层(单品-单店预测)适合自底向上的对账策略,因为底层数据的特异性强,自顶向下的信息传递可能引入偏差。
4.2 概率对账的前沿推进
点对账(point reconciliation)虽然保证了数值一致性,但在库存决策、容量规划等需要风险管理的情景下是不够的。概率对账(probabilistic reconciliation)要求在保持层级一致性的同时,维持校准良好的预测分布。Gomes等人通过残差块自助法(residual-block bootstrap)生成概率预测,并比较了不同模型在scaled CRPS指标上的表现。结果显示,最低的整体sCRPS由Transformer和Informer配合Bottom-Up对账共享(0.813),而Total级最低的sCRPS(0.037)来自PatchTST+MinTrace-WLS-struct。
4.3 端到端与两阶段的方法论之争
传统分层预测采用两阶段管线:先独立生成各层级的基准预测,再通过对账保证一致性。最近的工作开始探索端到端方法,将一致性约束直接嵌入模型训练。基于图神经网络的框架通过邻接矩阵建模层级依赖,将预测和对账联合优化。这种方法的优势在于避免了“预测偏差+对账偏差”的双重累积,但代价是模型复杂度的提升和训练稳定性的下降。
五、间歇性与稀疏需求:特征工程优先于架构复杂性
5.1 “特征工程优先”原则的实证检验
间歇性需求预测是销量预测中最困难的子问题之一,其特征是需求事件稀疏、零值占主导、需求间隔不规律。这一场景在汽车备件、工业耗材、医药长尾SKU中尤为常见。
一项发表于Scientific Reports的研究提出了一个反直觉但极具说服力的论点:对于间歇性需求预测,特征工程的重要性远超过架构复杂性。研究在约140万条月度观测数据上(覆盖56,000条备件时间序列)进行了11折滚动窗口交叉验证,结果表明,精心设计的特征工程策略在高度间歇性需求段中将MAE降低了约40%。
这一发现对当前销量预测领域的“架构军备竞赛”构成了重要的制衡。当研究者在Transformer变体、状态空间模型和混合架构之间反复比较时,这一研究提醒我们:数据的表示方式可能比模型的架构设计更重要。
5.2 备件需求的混合框架
“A Hybrid Temporal–Spatial Framework Incorporating Prior Knowledge for Predicting Sparse and Intermittent Item Demand”一文从另一个角度回应了间歇性需求的挑战。该框架融合了时间维度和空间维度的信息(同类产品的需求模式可相互借鉴)以及领域先验知识。其核心洞察是:间歇性需求的“间歇性”本身就是一个可预测的信号——当某类备件的需求在其他车型或地区出现增长时,这一增长可能通过共享的供应链或维修网络传导到目标SKU。
5.3 Switch-Hurdle与MoE架构
Switch-Hurdle模型提出了一个混合专家编码器与自回归Hurdle解码器的架构。Hurdle模型的核心思想是将预测分解为两个阶段:首先预测“是否会发生需求”,然后预测“如果发生需求,需求是多少”。这一分解天然适合间歇性数据的结构——零值的产生机制与非零值的产生机制可能由不同的因果过程驱动。
5.4 冷启动问题的两阶段框架
备件需求的冷启动问题——新产品上市时没有任何历史销售数据——是间歇性需求预测的极端形式。一项发表于PLOS ONE的研究提出了两阶段统计框架来解决“真正的冷启动”问题,其中“历史需求完全不可用且零膨胀占主导”。该框架首先基于产品属性、类别特征和领域知识生成先验需求估计,然后通过贝叶斯更新在获得首批销售数据后快速校正。这一方向的方法论意义在于:它承认了冷启动问题的本质是信息缺失,而信息缺失的解决之道不在于更复杂的模型架构,而在于更高效的信息获取和先验知识的系统利用。
六、LLM融合的新前沿:从事件知识到情感信号
6.1 事件驱动的需求预测
EventCast框架代表了LLM在销量预测中的一个关键应用方向:将未来事件知识整合到时间序列预测中。传统模型无法“知道”即将到来的事件如何影响需求——比如一个突发的社交媒体趋势、一条即将发布的行业政策、或一个即将举行的体育赛事。EventCast通过LLM的事件知识实现了这一整合,在事件驱动期间将MAE降低最多57.0%,MSE降低83.3%。
6.2 情感信号的结构化利用
LLM情感分析集成框架将在线评论中的情感信号从非结构化文本转化为结构化预测特征。该框架使用基于DeepSeek-V3.2的4-shot情感提取器实现了F1-score为0.966的情感分类,并将情感特征融合到SARIMAX、Prophet、LSTM、XGBoost和LightGBM五种模型中。结果显示,情感特征一致性地降低了预测误差,情感增强的XGBoost和LightGBM实现了最佳的整体表现。
这一研究的方法论贡献在于它将LLM定位为特征生成器而非预测器。LLM不需要直接输出销量预测——它只需要从非结构化文本中提取高质量的结构化信号,然后由专门的时间序列模型完成预测任务。这一分工充分利用了LLM的语义理解优势和传统时序模型的数值建模优势。
6.3 多模态融合的前沿探索
SMSF框架代表了销量预测向多模态融合的延伸。该框架基于信号理论,从短视频电商的8084条销售视频中提取视觉、听觉和文本信号,通过分层注意力和动态门控机制进行融合。LiveLens则从直播电商场景出发,通过专家访谈识别了16个跨视觉、听觉和文本维度的多模态指标,提出了在有限数据条件下的稳健预测框架。
多模态融合的方法论意义在于它回应了销量预测中一个被长期忽视的维度:需求的产生不仅受到可量化因素的影响,还受到不可量化的感知因素——如产品展示的视觉吸引力、主播的情绪感染力、社交媒体的传播热度——的驱动。
七、反思:销量预测科学的四重张力
7.1 基础模型收益的边界条件
系统综述的元分析提供了迄今最清晰的证据:基础模型在零售需求预测中的优势“在分布指标上最强,在点预测指标上较小”。这意味着基础模型的真实价值需要被重新定位:它们的主要贡献不是“预测得更准”,而是“预测得更全面”——更好地捕捉需求分布、尾部风险和不确定性区间。
这一重新定位对实践者的含义是:基础模型的部署策略不应是“一刀切”的全面替换,而应是基于场景的差异化部署。高价值、高波动性、数据稀缺的SKU适合基础模型,而数据充足、模式稳定的成熟SKU可能从精心调优的梯度提升树中获得更好的性价比。
7.2 因果识别的内生性困境
因果方法在销量预测中的应用面临一个根本约束:促销和定价决策的内生性。零售商不是随机决定促销活动的——它们基于对需求预期的判断来选择促销时机和力度。这意味着“处理分配”本身就是结果变量的函数,产生了反向因果的问题。
Causal-XAI框架使用DML来“正确识别真正的因果”,但DML的可识别性依赖于无未观测混杂假设。在实际零售环境中,“未观测混杂”几乎不可能被排除——消费者信心指数、社交媒体情绪、竞品的未公开策略都可能同时影响促销决策和销售结果。这意味着因果预测的“因果”标签需要被谨慎对待:它更准确地说是“因果-informed”的预测,即用因果假设约束的统计预测。
7.3 分层一致性与预测精度的权衡
分层预测研究揭示了一个重要的实践智慧:没有普遍最优的“架构-对账”组合,最优选择取决于层级深度和预测目标。战略层适合聚合模型+自顶向下对账,运营层适合细粒度模型+自底向上对账。这一发现挑战了预测科学中一个隐含的假设——存在一个在所有场景中都最优的“最佳实践”。取而代之的是一种情境化的方法论选择逻辑。
7.4 数据驱动与领域知识的再平衡
间歇性需求预测领域的“特征工程优先”原则提醒我们一个被深度学习浪潮掩盖的事实:领域知识的结构化编码可能比端到端的表示学习更有效。在备件预测中,“需求间隔”的统计特征、“零值模式”的时间结构、以及“同类产品需求传导”的先验知识,可能比增加Transformer层数带来更大的性能提升。
这一发现与可解释性研究形成了呼应。Explainable LightGBM-SHAP框架在UCI Online Retail II数据集上取得了RMSE为33.71的结果,其ICE分析揭示了“时间特征在某些产品集群中产生相反效应”——这意味着统一的重订货策略会系统性地为特定产品段错误分配库存。这种细粒度的异质性洞察,恰恰是纯端到端模型难以提供的。
八、结语
2025—2026年的销量预测科学正在经历一场从“精度竞赛”到“决策智能”的深层转型。基础模型的引入将预测的泛化能力推向了新的高度,但其真实收益需要在“分布指标 vs 点预测指标”和“精度增益 vs 部署成本”两个维度上被审慎评估。因果推断的深度嵌入使预测从“什么会卖掉”走向“为什么卖掉”和“怎样让它卖得更多”,从预测智能升级为处方智能。分层对账研究揭示了架构与对账方法的交互效应,挑战了“一刀切”的最佳实践假设。间歇性需求预测的“特征工程优先”原则为深度学习狂热提供了一剂清醒剂,而LLM融合、多模态信号、情感分析等新方向则将销量预测的信息基础从结构化历史数据扩展到了非结构化、多源、实时的信号生态。
销量预测科学的终极目标不是“预测得最准”,而是在不确定性中做出最好的库存、定价和促销决策。在这个意义上,销量预测的前沿不仅是技术的进步,更是预测科学从“告诉决策者答案”走向“赋予决策者洞察”的范式演进。
参考文献
[1] When Do Foundation Models Pay Off for Retail Demand Forecasting? A Systematic Review and Cross-Benchmark Meta-Analysis[J]. Zenodo, 2026.
[2] Gomes J, Oliveira J M, Ramos P. Probabilistic and Point Reconciliation in Deep Learning-Based Hierarchical Forecasting for Retail[J]. Sustainability, 2026, 18(17): 8746.
[3] Cárcamo F, Callejas S, Muñoz A, et al. Structural Causality and Evolutionary Optimization in Retail for Maximizing ROI in Promotional Campaigns[C]. ACM, 2026.
[4] LLM-Powered Dynamic Pricing Engine with Causal Inference for Retail and E-Commerce[J]. Zenodo, 2026.
[5] A Causal-XAI Framework for Retail Sales Forecasting: Addressing Transparency and Lack of Robustness in Deep Learning Models[C]. IEEE, 2026.
[6] Ricklin J C. Sales Forecasting and Pricing Strategy Optimization in the Retail Sector[D]. Etis Lab, 2026.
[7] Primacy of Feature Engineering over Architectural Complexity for Intermittent Demand Forecasting[J]. Scientific Reports, 2026.
[8] A Hybrid Temporal–Spatial Framework Incorporating Prior Knowledge for Predicting Sparse and Intermittent Item Demand[J]. 2026.
[9] Musat F, Cabuz S M. Switch-Hurdle: A MoE Encoder with AR Hurdle Decoder for Intermittent Demand Forecasting[J]. arXiv:2602.22685, 2026.
[10] Ren X, Li M, Li W, et al. LLM Sentiment Analysis-Integrated Sales Forecasting for E-Commerce—A Case Study on Amazon[J]. Digital Engineering, 2026.
[11] Hu C, Shi Y, Huang F, et al. EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge[J]. arXiv:2602.07695, 2026.
[12] Explainable Retail Demand Forecasting: A Hybrid LightGBM-SHAP Framework for Inventory Optimization[J]. IEEE Access, 2026.
[13] Meta-LLSTM: Meta-Learning Enhanced Learnable LSTM for Retail Sales Forecasting[J]. Scientific Reports, 2026, 16: 23928.
[14] Xu X, et al. SMSF: A Signal-Driven Multimodal Sequence Fusion Framework for Sales Prediction in Short-Form Video Commerce[J]. Decision Support Systems, 2026, 208.
[15] A Graph Neural Network-Based Framework for Hierarchical Time Series Forecasting in Retail[J]. 2026.
网硕互联帮助中心



评论前必须登录!
注册