ARIMA


1 总体介绍

  在以下主题中,我们将回顾有助于分析时间序列数据的技术,即遵循非随机顺序的测量序列。与在大多数其他统计数据的上下文中讨论的随机观测样本的分析不同,时间序列的分析基于数据文件中的连续值表示以等间隔时间间隔进行的连续测量的假设。

本节描述的方法的详细讨论可以在Anderson(1976),Box and Jenkins(1976),Kendall(1984),Kendall and Ord(1990),Montgomery,Johnson和Gardiner(1990),Pankratz(1983)中找到。 ),Shumway(1988),Vandaele(1983),Walker(1991)和Wei(1989)。

2 两个主要目标

时间序列分析有两个主要目标:

(a)确定观察序列所代表的现象的性质。

(b)预测(预测时间序列变量的未来值)。

这两个目标都要求识别观察到的时间序列数据的模式,并且或多或少地正式描述。一旦模式建立,我们就可以将其与其他数据进行解释和整合(即,在我们的调查现象理论中使用它,例如季节性商品价格)。无论我们的理解深度和我们对该现象的解释(理论)的有效性,我们都可以推断出已识别的模式以预测未来事件。

3 识别时间序列数据中的模式

3.1系统模式和随机噪声

与大多数其他分析一样,在时间序列分析中,假设数据由系统模式(通常是一组可识别组件)和随机噪声(错误)组成,这通常使模式难以识别。大多数时间序列分析技术涉及过滤噪声的某种形式,以使图案更加突出。

3.2时间序列模式的两个一般方面

大多数时间序列模式可以用两个基本类别的组件来描述:趋势和季节性前者代表一般的系统线性或(最常见)非线性成分,其随时间变化并且在我们的数据捕获的时间范围内不重复或至少不重复(例如,*台随后是指数生长期)。后者可能具有正式相似的性质(例如,*稳期随后呈指数增长期),然而,随着时间的推移,它在系统间隔中重复。这两个通用类别的时间序列组件可以共存于现实数据中。例如,公司的销售额可以快速增长多年,但仍然遵循一致的季节性模式(例如,12月份每年销售额的25%,而8月份仅为4%)。

时间序列

这种一般模式在“经典” G系列数据集(Box和Jenkins,1976,第531页)中有很好的说明,代表了从1949年到1960年连续12年的月度国际航空公司乘客总数(以千计)(见示例数据文件)G.sta和上图)。如果绘制航空公司乘客总数的连续观测值(月份),则会出现明显的线性趋势,表明航空业多年来保持稳定增长(1960年乘客人数比1949年增加约4倍)。同时,每月的数字将遵循几乎相同的模式(例如,假期期间旅行的人数比一年中的任何其他时间都多)。该示例数据文件还示出了时间序列数据中非常常见的一般类型的模式,其中季节变化的幅度随着总体趋势而增加(即,方差与系列的片段上的*均值相关)。这种模式称为乘法季节性表明季节变化的相对幅度随时间变化是恒定的,因此它与趋势有关。

3.3趋势分析

没有经过验证的“自动”技术来识别时间序列数据中的趋势分量; 然而,只要趋势是单调的(持续增加或减少),那么部分数据分析通常不是很困难。如果时间序列数据包含相当大的误差,那么趋势识别过程的第一步就是*滑

*滑*滑总是涉及某种形式的局部数据*均,使得各个观察的非系统成分相互抵消。最常见的技术是移动*均*滑,它用n个周围元素的简单或加权*均值替换系列的每个元素,其中n*滑“窗口”的宽度(见Box&Jenkins,1976; Velleman&Hoaglin,1981)。可以使用中位数而不是手段。与移动*均*滑相比,中值的主要优点是其结果不受异常值的偏差(在*滑窗口内)。因此,如果数据中存在异常值(例如,由于测量误差),则中值*滑通常比基于相同窗口宽度的移动*均产生更*滑或至少更“可靠”的曲线。中值*滑的主要缺点是,在没有明显的异常值的情况下,它可能产生比移动*均值更多的“锯齿状”曲线,并且不允许加权。

在相对较不常见的情况下(在时间序列数据中),当测量误差非常大时,可以使用距离加权最小二乘*滑负指数加权*滑技术。所有这些方法都会滤除噪声并将数据转换为相对不受异常值影响的*滑曲线(有关详细信息,请参阅每个方法的相应章节)。具有相对较少且系统分布的点的系列可以用双三次样条*滑

适合功能许多单调的时间序列数据可以通过线性函数充分*似; 如果存在明显的单调非线性分量,则首先需要对数据进行变换以消除非线性。通常可以使用对数,指数或(不太常见)多项式函数。

3.4季节性分析

季节依赖性(季节性)是时间序列模式的另一个通用组成部分。上述航空公司乘客数据的例子说明了这个概念。它被正式定义为系列的每个第i个元素和第(ik)个元素(Kendall,1976)之间的阶数k的相关依赖性,并且通过自相关(即,两个术语之间的相关性)来测量; k通常称为滞后如果测量误差不是太大,则可以在系列中视觉识别季节性,作为重复每个k元素的模式

自相关相关图。可以通过相关图检查时间序列的季节性模式。相关图(自相关图)以图形和数字方式显示自相关函数(ACF),即,在指定的滞后范围(例如,1到30)内的连续滞后的串行相关系数(及其标准误差)。每个滞后的两个标准误差的范围通常在相关图中标出,但通常自相关的大小比其可靠性更有意义(参见基本概念),因为我们通常只对非常强(因此非常重要)的自相关感兴趣。

Image result for 自相关

检查相关图。在检查相关图时,您应该记住,连续滞后的自相关正式依赖。请考虑以下示例。如果第一个元素与第二个元素密切相关,第二个元素与第二个元素密切相关,那么第一个元素也必须与第三个元素有些相关,等等。这意味着在删除第一个元素后,序列依赖关系的模式可能会发生很大变化自相关(即差分系列后滞后为1)。


偏自相关检查序列依赖关系的另一个有用方法是检查偏自相关函数(PACF) - 自相关的扩展,其中依赖于中间元素(内部元素)滞后)被删除。换句话说,偏自相关类似于自相关,除了在计算它时,与滞后内所有元素的(自动)相关性被偏离(Box&Jenkins,1976;另见McDowall,McCleary,Meidinger,&Hay, 1980年)。如果指定滞后1(即,滞后内没有中间元素),则偏自相关等效于自相关。从某种意义上说,偏自相关为各个滞后提供了“更清晰”的串行依赖关系图(不会被其他串行依赖关系混淆)。

删除串行依赖可以通过对系列进行差分来消除k的特定滞后的串行依赖性,即将该系列??的每个第i个元素转换为与第(ik)个元素的差异这种转变有两个主要原因。

首先,我们可以确定系列中季节性依赖的隐藏性质。请记住,正如前一段所述,连续滞后的自相关是相互依赖的。因此,删除一些自相关将改变其他自动相关性,也就是说,它可能会消除它们,或者它可能使其他一些季节性更明显。

消除季节性依赖性的另一个原因是使系列稳定,这是ARIMA和其他技术所必需的 

4 ARIMA

可以拆分成AR MA I三个部分来讲,首先是AR(自回归模型)

P阶其实就是当前值和历史前几个值有关,如果p等于1就有前一个值有关,等于2与前两个值有关,然后进行累加,求解参数。

MA

ARMA

I

表示差分,通过差分来*稳化

4.1总体介绍

识别时间序列数据模式中讨论的建模和预测程序涉及过程数学模型的知识。然而,在现实生活中的研究和实践中,数据模式尚不清楚,个别观察涉及相当大的误差,我们仍然需要不仅揭示数据中隐藏的模式,还需要生成预测。Box和Jenkins(1976)开发的ARIMA方法允许我们这样做; 它在许多领域获得了极大的普及,研究实践证实了它的力量和灵活性(Hoff,1983; Pankratz,1983; Vandaele,1983)。然而,由于其强大的功能和灵活性,ARIMA是一项复杂的技术; 它不易使用,需要大量的经验,虽然它经常产生令人满意的结果,但这些结果取决于研究人员的专业水*(Bails&Peppers,1982)。以下部分将介绍此方法的基本概念。对于那些对应用导向(非数学),ARIMA方法介绍感兴趣的人,我们推荐McDowall,McCleary,Meidinger和Hay(1980)。

4.2两个常见的过程

自回归过程。大多数时间序列由连续依赖的元素组成,在这种意义上,您可以从特定的,时间滞后的(先前的)元素中估计描述系列的连续元素的系数或系数集。这可以总结在等式中:t = 1 * x (t-1) + 2 * x (t-2) + 3 * x (t-3) + ... +

                 是一个常数(截距),和
 123    是自回归模型参数。

用语言来说,每个观察由随机误差分量(随机冲击)和先前观察的线性组合组成。

可变性要求。没有太多细节,移动*均过程和自回归过程之间存在“二元性”(例如,参见Box&Jenkins,1976; Montgomery,Johnson,&Gardiner,1990),即上面的移动*均方程可以被重写(反转)成自回归形式(无限次序)。然而,类似于上述*稳性条件,这只能在移动*均参数遵循某些条件时,即,如果模型是可逆的情况下才能进行否则,序列将不会稳定

4.3ARIMA方法论

自回归移动*均模型。Box和Jenkins(1976)引入的一般模型包括自回归和移动*均参数,并明确包括模型公式中的差分。具体而言,模型中的三种参数是:自回归参数(p),差分通过次数(d)和移动*均参数(q)。在Box和Jenkins介绍的符号中,模型总结为ARIMA(p,d,q); 因此,例如,描述为(0,1,2)的模型意味着它包含0(零)自回归(p)参数和2个移动*均值(q)在一次差异之后为该系列计算的参数。

识别。如前所述,ARIMA的输入序列需要是固定的,也就是说,它应该具有恒定的均值,方差和随时间变化的自相关性。因此,通常首先需要对系列进行区分,直到它静止为止(这通常还需要对数据进行对数转换以稳定方差)。为了实现*稳性,系列需要区分的次数反映在d中参数(见前一段)。为了确定必要的差分水*,您应该检查数据和自相关图的图。水*的显着变化(强烈的向上或向下变化)通常需要一阶非季节性(滞后= 1)差异; 坡度的强烈变化通常需要二阶非季节差分。季节性模式需要各自的季节差异(见下文)。如果估计的自相关系数在较长的滞后处缓慢下降,则通常需要一阶差分。但是,您应该记住,某些时间序列可能需要很少或不需要差分,并且差异系列会产生较不稳定的系数估计值。

在这个阶段(通常称为识别阶段,见下文),我们还需要确定有多少自回归(p)和移动*均(q)参数是必要的,以产生一个有效但仍然简约的过程模型(简约意味着它在所有适合数据的模型中具有最少的参数和最大的自由度。在实践中,pq参数的数量很少需要大于2(更具体的建议见下文)。

估计和预测。在下一步(估计),估计参数(使用函数最小化过程,见下文;有关最小化过程的更多信息,请参见非线性估计),以便最小化残差*方和。在最后阶段(预测中使用参数的估计来计算序列的新值(超出输入数据集中包括的那些值)和那些预测值的置信区间。对变换(差分)数据执行估计过程; 在生成预测之前,需要整合该系列(积分是差分的倒数),以便预测以与输入数据兼容的值表示。该自动积分特征由方法名称中的字母I表示(ARIMA =自动回归综合移动*均值)。

ARIMA模型中的常量。除了标准的自回归和移动*均参数之外,ARIMA模型还可以包括常数,如上所述。(统计上显着的)常数的解释取决于适合的模型。具体来说,(1)如果模型中没有自回归参数,则常数的期望值是系列的均值; (2)如果序列中存在自回归参数,则常数表示截距。如果序列不同,则常数表示差异序列的均值或截距; 例如,如果序列差异一次,并且模型中没有自回归参数,则常量表示差异序列的均值,因此无差别序列的线性趋势斜率算法(所谓的准牛顿法;参考非线性估计的描述) 方法)在给定参数值的情况下最大化观察到的序列的似然性(概率)。实际上,这需要在给定相应参数的情况下计算残差的(条件)*方和(SS)。已经提出了不同的方法来计算残差的SS:(1)根据McLeod和Sales(1983)的*似最大似然法,(2)具有反向的*似最大似然法,以及(3)精确的最大似然法根据Melard(1984)。

比较方法。通常,所有方法都应该产生非常相似的参数估计。此外,在大多数现实世界的时间序列应用中,所有方法都具有相同的效率。然而,上面的方法1(*似最大似然,没有后向)是最快的,并且应该特别用于非常长的时间序列(例如,具有超过30,000个观测值)。Melard的精确最大似然法(数字3当用于估计具有长季节性滞后的季节性模型(例如,每年滞后365天)的参数时,上述)也可能变得低效。另一方面,您应该首先使用*似最大似然法,以便建立非常接*实际最终值的初始参数估计; 因此,通常只需要几次具有精确最大似然法(3,以上)的迭代来完成参数估计。

参数标准错误。对于所有参数估计,您将计算所谓的渐*标准误差这些是通过有限差分*似的二阶偏导数矩阵计算的(另请参见非线性估计中的相应讨论)。

罚款价值。如上所述,估计过程要求最小化ARIMA残差的(条件)*方和。如果模型不合适,则在迭代估计过程期间可能发生参数估计变得非常大,并且实际上无效。在这种情况下,它将为SS 分配一个非常大的值(所谓的惩罚值)。这通常会“诱导”迭代过程以使参数远离无效范围。但是,在某些情况下,甚至此策略也会失败,您可能会在屏幕上看到(在估算过程中))连续迭代中SS的非常大的值。在这种情况下,请仔细评估模型的适用性。如果您的模型包含许多参数,并且可能包含干预组件(请参见下文),则可以尝试使用不同的参数起始值。

4.6评估模型

参数估计。您将报告从参数标准误差计算的*似t值(参见上文)。如果不显着,则在大多数情况下可以从模型中删除相应参数而基本上不影响模型的整体拟合。

其他质量标准。对模型可靠性的另一个直接和常见的衡量标准是基于部分数据生成的预测的准确性,以便可以将预测与已知(原始)观测结果进行比较。

然而,一个好的模型不仅应该提供足够准确的预测,它还应该是简约的并且产生仅包含噪声且没有系统组件的统计独立残差(例如,残差的相关图不应该揭示任何序列依赖性)。对模型的一个很好的测试是(a)绘制残差并检查它们是否存在任何系统趋势,以及(b)检查残差的自相关图(残差之间不应存在序列依赖性)。

残差分析。这里主要关注的是残差系统地分布在整个系列中(例如,它们在序列的第一部分可能是负的,在第二部分中可能接*零)或者它们包含一些序列依赖性,这可能表明ARIMA模型是不够的。对ARIMA残差的分析构成了该模型的重要检验。估计过程假设残差不是(自动)相关的并且它们是正态分布的。

限制。ARIMA方法仅适用于静止的时间序列(即,其*均值,方差和自相关应在时间上*似恒定),并且建议输入数据中至少有50个观测值。还假设估计参数的值在整个系列中是恒定的。

5 指数*滑

5.1总体介绍

指数*滑作为各种时间序列数据的预测方法已经变得非常流行。历史上,该方法由Brown和Holt独立开发。布朗在第二次世界大战期间为美国海军工作,他的任务是设计一个火控信息跟踪系统来计算潜艇的位置。后来,他将这种技术应用于备件需求预测(库存控制问题)。他在1959年关于库存控制的书中描述了这些想法。霍尔特的研究由海军研究办公室赞助; 他独立地为恒定过程,线性趋势过程和季节性数据开发了指数*滑模型。

Gardner(1985)提出了指数*滑方法的“统一”分类。在Makridakis,Wheelwright和McGee(1983),Makridakis和Wheelwright(1989),Montgomery,Johnson和Gardiner(1990)中也可以找到优秀的介绍。ARIMA的观点,暗示0 << 2)。Gardner(1985)报道,在从业者中,通常建议小于.30。然而,在Makridakis 等人的研究中(1982),高于.30的值经常产生最佳预测。在回顾了有关该主题的文献后,Gardner(1985)得出结论,最好从数据中估算出最优值(见下文),而不是“猜测”并设定人为的低值。

估算数据的最佳价值。实际上,*滑参数通常通过参数空间网格搜索选择也就是说,尝试不同的解决方案,例如,使用= 0.1到= 0.9,增量为0.1。然后选择以便产生残差的最小*方和(或均方)(即,观测值减去一步预测;这个均方误差也称为事后*均误差,事后 MSE简称)。ARIMA中相同,用于最小化均方误差,*均绝对误差或*均绝对百分误差。在大多数情况下,此过程比网格搜索更有效(特别是当更多时)必须确定一个参数,并且可以快速识别最佳参数。

第一个*滑值0到目前为止我们忽略的最后一个问题是初始值的问题,或者如何开始*滑过程。如果您回顾上面的公式,很明显您需要一个0值来计算系列中第一个观测值的*滑值(预测值)。取决于参数的选择(即,何时接*零),*滑过程的初始值会影响许多观测的预测质量。与指数*滑的大多数其他方面一样,建议选择产生最佳预测的初始值。另一方面,在实践中,当在关键的实际预测之前有许多主要观察结果时,初始值不会对该预测产生太大影响,因为其影响将长期从*滑系列中“淡化”(由于指数增长)减少权重,观察越老,它对预测的影响就越小。指数*滑方法,也可以包含季节性和趋势分量,是预测目的的首选技术。)

添加和乘法季节性让我们考虑一个例子中的加性和乘法季节性成分之间的差异:玩具的年销售量可能在11月和12月的几个月达到峰值,也许在夏季(峰值小得多)儿童夏季休息时。这种季节性模式可能每年重复一次。季节性成分本质上可以是加成的或可乘的。例如,在12月份,特定玩具的销售额每年可能增加300万美元。因此,我们可以增加我们的预测为每年十二月的300万量,占这种季节性波动。在这种情况下,季节性是附加的或者,在12月期间,特定玩具的销售额可能会增加40%,即增加1.4倍。因此,当玩具的销售普遍疲软时,12月份的销售绝对(美元)增长将相对较弱(但百分比将保持不变); 如果玩具的销售强劲,那么销售的绝对(美元)增长将成比例地增加。同样,在这种情况下,销售额增加一定的因素,因此季节性因素是乘法的在本质上(即,在这种情况下,乘法季节性成分将是1.4)。在系列图中,这两种季节性成分之间的区别特征是,在附加情况下,无论系列的总体水*如何,该系列都表现出稳定的季节性波动; 在乘法情况下,季节性波动的大小会有所不同,具体取决于系列的总体水*。

加法和乘法趋势周期。我们可以扩展前面的例子来说明加法和乘法趋势周期分量。就我们的玩具示例而言,这是一种“时尚” 趋势可能会导致销售额稳步增长(例如,一般趋向于更多教育玩具); 与季节性因素一样,这种趋势可能是附加的(销售额每年增加300万美元)或乘数(销售额增加30%,或每年增加1.3倍)。此外,周期性组件可能会影响销售; 重申一下,周期性成分与季节性成分的不同之处在于它通常具有较长的持续时间,并且它以不规则的间隔发生。例如,特定玩具在夏季期间可能特别“热”(例如,与主要儿童电影的发行相关联的特定玩偶,并且通过广泛的广告促销)。同样,这种循环组件可以以附加方式或乘法方式实现销售。

计算

季节性分解(人口普查I)标准公式示于Makridakis,惠尔赖特,和麦基(1983),和Makridakis和车匠(1989)。

移动*均线。首先计算该系列的移动*均值,移动*均窗口宽度等于一个季节的长度。如果季节的长度是均匀的,那么用户可以选择使用相等的权重用于移动*均值,或者可以使用不等权重,其中移动*均窗口中的第一个和最后一个观察值被*均。

比率或差异。在移动*均值系列中,将消除所有季节性(季节内)变化; 因此,观察和*滑系列的差异(在加性模型中)或比率(在乘法模型中)将隔离季节性成分(加上不规则成分)。具体地,从观察到的系列中减去移动*均值(对于加法模型)或者将观察到的序列除以移动*均值(对于乘法模型)。

季节性成分。然后将季节性成分计算为季节中每个点的*均值(对于加性模型)或中间*均值(对于乘法模型)。

(一组值的中间*均值是排除最小值和最大值后的*均值)。结果值表示系列的(*均)季节性组件。

经季节性调整的系列。原始系列可以通过从中减去(加法模型)或除以(乘法模型)季节性成分来进行调整。

由此产生的系列是经过季节性调整的系列(即季节性成分将被删除)。

趋势周期组件。请记住,周期性成分与季节性成分的不同之处在于它通常比一个季节长,不同的周期可能有不同的长度。通过对季节性调整的系列应用权重为1,2,3,2,1的5点(居中)加权移动*均*滑变换,可以*似组合趋势和周期分量。

随机或不规则的组件。最后,可以通过从经季节性调整的系列(加法模型)中减去或将调整后的系列除以(乘法模型)趋势周期分量来分离随机或不规则(误差)分量。


注:本文翻译于网站http://www.statsoft.com/textbook/time-series-analysis