När du beräknar ett löpande rörligt medelvärde, är det genomsnittligt att placera genomsnittet i mellantidstiden. I föregående exempel beräknade vi genomsnittet av de första 3 tidsperioderna och placerade det bredvid period 3. Vi kunde ha placerat medelvärdet mitt i tidsintervall av tre perioder, det vill säga bredvid period 2. Detta fungerar bra med udda tidsperioder, men inte så bra för jämn tid. Så vart skulle vi placera det första glidande medlet när M 4 Tekniskt sett skulle det rörliga genomsnittet falla vid t 2.5, 3.5. För att undvika detta problem släpper vi MAs med M 2. Således släpper vi de jämnderade värdena Om vi i genomsnitt ett jämnt antal termer behöver vi släta de jämnda värdena Följande tabell visar resultaten med M 4. För att beräkna ett l Termiskt glidande medelvärde för l ett jämnt heltal måste vi göra det som kallas centrera det glidande medlet. Detta görs enligt följande: Först beräkna det enkla glidande medelvärdet. Följ därefter det centrerade glidande medelvärdet genom att medelvärda angränsande värden för dessa enkla glidgängder: När l2. det centrerade glidande medlet kallas Hanning. Det är av formuläret. Tänk på att beräkna ett 4-sikt glidande medelvärde för de första 10 datavärdena för SASDATA. INTAIR-data (en dataset som består av de månatliga siffrorna i tusentals passagerare på internationella flygbolagen för År 1949 till och med 1960). De ursprungliga uppgifterna är 112.118.132.129.131.135.148.148.136.119. För att få de tre första terminerna för 4-termen glidande medelvärde beräknas först de första tre centrerade glidande medelvärdena. Dessa är de tre första värdena för 4-termen glidande medelvärdet. Joseph D Petruccelli Tue Feb 21 14:15:46 EST 1995Moving Averages och Centered Moving Averages Ett par punkter om säsongsmässighet i en tidsserie bära upprepa, även om de verkar uppenbara. En är att termen 8220season8221 inte nödvändigtvis hänvisar till årets fyra årstider, som härrör från lutningen av Earth8217s axel. I predictive analytics betyder 8220season8221 ofta just det, för många av fenomenen som vi studerar varierar ihop med vårens framsteg i vinter: försäljning av vinter - eller sommarutrustning, förekomsten av vissa utbredda sjukdomar, väderhändelser orsakade av platsen för jetström och förändringar i temperaturen på vattnet i östra Stilla havet, och så vidare. Likaså kan händelser som uppträder regelbundet fungera som meteorologiska årstider, även om de bara har en tuff anslutning till solstickorna och equinoxerna. Åtta timmars skift på sjukhus och fabriker uttrycks ofta i förekomsten av intag och utgifter för energi där, en säsong är åtta timmar lång och årstiderna cyklar varje dag, inte varje år. Förfallodagar för skatter signalerar början av en översvämning av dollar till kommunala, statliga och federala skattemyndigheter där, kan säsongen vara ett år lång (personlig inkomstskatt), sex månader (fastighetsskatt i många stater), kvartalsvis (många företagsskatter ), och så vidare. It8217 är lite konstigt att vi har ordet 8220season8221 att referera generellt till den regelbundet återkommande tidsperioden, men ingen generell term för tidsperioden under vilken en fullständig årstidsändring inträffar. 8220Cycle8221 är möjlig, men i analyser och prognoser brukar begreppet normalt innebära en obestämd längd, såsom en konjunkturcykel. I avsaknad av en bättre term, använde I8217ve 8220enomfattande period8221 i detta och efterföljande kapitel. Detta är bara terminologiskt musing. De sätt vi identifierar årstider och den tidsperiod under vilken årstiderna har verkliga, om det är ofta mindre, konsekvenser för hur vi mäter deras effekter. I följande avsnitt diskuteras hur vissa analytiker varierar hur de beräknar glidande medelvärden beroende på om antalet årstider är udda eller jämnt. Använda rörliga medelvärden istället för enkla medelvärden Anta att en storstad överväger omfördelningen av sin trafikpolis för att bättre ta itu med förekomsten av körning medan nedsatt, vilket staden anser har ökat. För fyra veckor sedan trädde ny lagstiftning i kraft, vilket legaliserar innehav och fritidsbruk av marijuana. Sedan dess verkar det dagliga antalet trafikanställningar för DWI vara trending. Komplicerande är det faktum att antalet anhållanden verkar spika på fredagar och lördagar. För att hjälpa till att planera för arbetskraftsbehov i framtiden, gillar du att förutse vilken underliggande trend som etableras. You8217d gillar också att utnyttja dina resurser för att ta hänsyn till vilken helgrelaterad säsong som8217s äger rum. Figur 5.9 har relevanta uppgifter som du måste arbeta med. Figur 5.9 Med denna dataset utgör varje dag i veckan en säsong. Även genom att bara eyeballa diagrammet i Figur 5.9. Du kan säga att trenden på antalet dagliga arresteringar är uppe. You8217ll måste planera att expandera antalet trafik officerare, och hoppas att trenden nivåer av snart. Vidare utgår uppgifterna från att fler arresteringar sker rutinmässigt på fredagar och lördagar, så din resursfördelning behöver hantera dessa spikar. Men du måste kvantifiera den underliggande trenden för att bestämma hur många extra polis du måste ha på dig. Du måste också kvantifiera den förväntade storleken på weekendspikesna, för att bestämma hur många extra polis du behöver titta på för ojämna drivrutiner på dessa dagar. Problemet är att från och med nu vet du inte hur mycket av den dagliga ökningen beror på trend och hur mycket beror på den helgenseffekten. Du kan börja genom att avbryta tidsserierna. Tidigare i det här kapitlet, i 8220Simple Seasonal Averages, 8221 såg du ett exempel på hur man avskräcker en tidsserie för att isolera säsongseffekterna med hjälp av metoden för enkla medelvärden. I det här avsnittet ser du hur du gör det med hjälp av glidande medelvärden8212. Det är mycket sannolikt att metoden för glidande medel används oftare i prediktiv analys än vad som är enkla medelvärderingsmetoden. Det finns olika orsaker till den ökande populariteten hos glidande medelvärden, bland dem, att den genomsnittliga metoden inte ber dig att kollapsa dina data i processen att kvantifiera en trend. Minns att det tidigare exemplet gjorde det nödvändigt att kollapsa kvartalsmedelvärden till årliga medelvärden, beräkna en årlig trend och sedan fördela en fjärdedel av den årliga trenden över varje kvartal i året. Det steget var nödvändigt för att ta bort trenden från säsongseffekterna. Däremot gör det med medelvärdet att du kan tömma tidsserierna utan att tillgripa den typen av bearbetning. Figur 5.10 visar hur rörelsegradsmetoden fungerar i det nuvarande exemplet. Figur 5.10 Det rörliga genomsnittet i det andra diagrammet förtydligar den underliggande trenden. Figur 5.10 lägger till en glidande medelkolumn och en kolumn för specifika säsonger. till datasatsen i figur 5.9. Båda tillägg kräver en del diskussioner. Spikarna i arresteringar som äger rum på helgerna ger dig anledning att tro att du arbetar med årstider som upprepas en gång i veckan. Börja därför med att få medeltalet för den omfattade perioden8212, det är de första sju årstiderna, måndag till söndag. Formeln för genomsnittet i cell D5, det första tillgängliga glidande medlet, är följande: Den här formeln kopieras och klistras in via cell D29, så du har 25 glidande medelvärden baserat på 25 körningar på sju dagar i följd. Observera att för att visa både de första och de sista observationerna i tidsserierna, har jag dolda rader 10 till 17. Du kan förklara dem, om du vill, i denna kapitel8217s arbetsbok, tillgänglig från publisher8217s hemsida. Gör ett flertal urval av synliga rader 9 och 18, högerklicka på en av sina radhuvud och välj Unhide från genvägsmenyn. När du döljer ett arbetsblad8217s rader, som I8217ve gjort i Figur 5.10. Alla kartade data i de dolda raderna är också dolda på diagrammet. X-axeln-etiketterna identifierar endast de datapunkter som visas på diagrammet. Eftersom varje glidande medelvärde i figur 5.10 omfattar sju dagar, är inget glidande medelparat ihop med de tre första eller sista tre faktiska observationerna. Kopiera och klistra in formeln i cell D5 upp en dag till cell D4 leder dig ur observationer8212.Det finns ingen observation registrerad i cell C1. På liknande sätt finns inget rörligt medel registrerat under cellen D29. Kopiering och klistra in formeln i D29 till D30 skulle kräva en observation i cell C33, och ingen observation är tillgänglig för den dag som cellen skulle representera. Det skulle naturligtvis vara möjligt att förkorta längden på glidande medelvärdet, till exempel fem i stället för sju. Det innebär att de rörliga medelformlerna i Figur 5.10 kan börja i cell D4 istället för D5. Men i denna typ av analys vill du längden på det rörliga genomsnittet vara lika med antalet årstider: sju dagar i veckan för händelser som återkommer varje vecka innebär ett glidande medelvärde av längden sju och fyra fjärdedelar om året för händelser som återkommer årligen innebär ett glidande medelvärde av längd fyra. På samma sätt kvantifierar vi generellt säsongseffekter på ett sådant sätt att de uppgår till noll inom den överenskomna tidsperioden. Som du såg i detta kapitel8217s första avsnitt, om enkla medelvärden görs detta genom att beräkna genomsnittet av (säg) de fyra kvartalen på ett år och sedan subtrahera årets genomsnitt från varje kvartalsfigur. Det gör så att totala säsongseffekterna är noll. I sin tur är that8217s användbara eftersom det sätter säsongsbetonade effekter på en vanlig footing8212a sommar effekt av 11 är så långt från medelvärdet som en vinter effekt av 821111. Om du vill ha genomsnittliga fem årstider i stället för sju för att få ditt rörliga medelvärde, you8217re bättre Av att hitta ett fenomen som upprepas vart femte årstider istället för varje sju. Men när du tar medeltiden av säsongseffekterna senare i processen, är dessa medelvärden osannolikt att summera till noll. It8217s behövs vid den tidpunkten för att kalibrera eller normalisera. medelvärdena så att deras summa är noll. När det är klart att de genomsnittliga säsongsgenomsnitten uttrycker effekten under en tidsperiod som hör till en viss årstid. När det har normaliserats kallas säsongsvärdena de säsongsindex som detta kapitel redan har nämnt flera gånger. You8217ll se hur det fungerar senare i det här kapitlet, i 8220Detändra serien med rörliga medelvärden.8221 Förstå specifika säsongsår Figur 5.10 visar också vad som kallas specifika säsonger i kolumn E. De är what8217s kvar efter att ha dragit det rörliga genomsnittet från den faktiska observationen. För att få en känsla av vad de specifika säsongerna representerar, överväg det glidande medlet i cell D5. Det är genomsnittet av observationerna i C2: C8. Avvikelserna för varje observation från det rörliga genomsnittet (till exempel C2 8211 D5) garanteras att summa till noll8212that8217s en egenskap av ett medelvärde. Därför uttrycker varje avvikelse effekten av att vara associerad med den speciella dagen under den aktuella veckan. It8217 är en specifik säsong, då8212specifik eftersom avvikelsen gäller för den aktuella måndagen eller tisdag och så vidare och säsongsbetonat eftersom i detta exempel vi behandlar varje dag som om det var en säsong under den närmaste perioden på en vecka. Eftersom varje enskild säsongsåtgärd effekten av att vara under den säsongen vis-224-vis det glidande medelvärdet för den här gruppen av (här) sju årstider, kan du sedan medge de specifika årstiderna för en viss årstid (till exempel alla fredagar i din tidsserier) för att uppskatta den season8217s generella, snarare än specifika, effekt. Det genomsnittet är inte förvirrat av en underliggande trend i tidsserierna, eftersom varje specifikt säsong uttrycker en avvikelse från sitt eget rörliga medelvärde. Att jämföra de rörliga genomsnittserna There8217s är också frågan om att anpassa de rörliga medeltalet med den ursprungliga datamängden. I figur 5.10. Jag har anpassat varje glidande medelvärde med mitten av det antal observationer som den innehåller. Så exempelvis är formeln i cell D5 genomsnittliga observationerna i C2: C8, och jag har anpassat den med den fjärde observationen, mittpunkten för det genomsnittliga intervallet, genom att placera det i rad 5. Detta arrangemang kallas ett centrerat glidande medelvärde . och många analytiker föredrar att justera varje glidande medelvärde med mittpunkten för de observationer som den medeltar. Tänk på att i detta sammanhang refererar 8220midpoint8221 till mitten av en tidsperiod: torsdag är mittpunkten måndag till söndag. Det hänvisar inte till medianen av de observerade värdena, men det kan naturligtvis fungera på det sättet i praktiken. Ett annat tillvägagångssätt är det efterföljande rörliga genomsnittet. I det fallet justeras varje glidande medelvärde med den slutliga observationen att den är genomsnittlig8212 och därför springer den bakom sina argument. Det här är ofta det föredragna arrangemanget om du vill använda ett glidande medelvärde som en prognos, som görs med exponentiell utjämning, eftersom ditt slutliga rörliga medel inträffar i samband med den slutliga tillgängliga observationen. Centrerade rörliga medelvärden med jämn antal årstider Vi brukar anta ett speciellt förfarande när antalet årstider är jämnt snarare än udda. That8217s typiska tillstånd: Det finns ett jämnt antal årstider under den överenskomna perioden för typiska årstider som månader, kvartaler och fjärdedelar (för val). Svårigheten med ett jämnt antal årstider är att det inte finns någon mittpunkt. Två är inte mittpunkten för ett område som börjar vid 1 och slutar vid 4, och det är inte heller 3 om man kan säga att man har en, dess mittpunkt är 2,5. Sex är inte mittpunkten 1 till 12, och inte heller 7 är dess rent teoretiska mittpunkt är 6,5. För att fungera som om en mittpunkt existerar, måste du lägga till ett lager av medelvärde ovanpå de glidande medelvärdena. Se figur 5.11. Figur 5.11 Excel erbjuder flera sätt att beräkna ett centrerat glidande medelvärde. Tanken bakom detta tillvägagångssätt för att få ett glidande medelvärde som8217s centreras på en befintlig mittpunkt, när det är ett jämnt antal årstider, är att dra denna mittpunkt framåt med en halv säsong. Du beräknar ett glidande medelvärde som skulle vara centrerat till, till exempel, den tredje punkten om fem säsonger istället för fyra utgjorde en fullständig kalenderändning. That8217s görs genom att ta två på varandra följande glidande medelvärden och medelvärda dem. Så i Figur 5.11. There8217s ett glidande medelvärde i cell E6 som medeltalvärdena i D3: D9. Eftersom det finns fyra säsongsvärden i D3: D9, anses det rörliga genomsnittet i E6 vara centrerat vid den imaginära säsongen 2,5, en halv punkt kort före den första tillgängliga kandidatperioden 3. (Årstiderna 1 och 2 är inte tillgängliga som mittpunkter för brist på data i genomsnitt före säsong 1.) Observera att det rörliga genomsnittet i cell E8 medeltalvärdena i D5: D11, den andra genom den femte i tidsserierna. Det genomsnittet är centrerat på (imaginärt) punkt 3.5, en hel period före genomsnittet centrerad vid 2,5. Genom att medelvärda de två glidande medelvärdena, så tänkandet går, kan du dra mittpunkten för det första glidande medlet framåt med en halv punkt, från 2,5 till 3. That8217s vad medelvärdena i kolumn F i Figur 5.11 gör. Cell F7 ger medelvärdet av de glidande medelvärdena i E6 och E8. Och medelvärdet i F7 är i linje med den tredje datapunkten i de ursprungliga tidsserierna, i cell D7, för att betona att medlet är centrerat på den säsongen. Om du expanderar formeln i cell F7 liksom de glidande medelvärdena i cellerna E6 och E8 ser du att du visar att det visar sig vara ett viktat medelvärde av de första fem värdena i tidsserierna, varvid det första och femte värdet ges en vikt av 1 och den andra genom fjärde värden som ges en vikt av 2. Det leder oss till ett snabbare och enklare sätt att beräkna ett centrerat glidande medelvärde med ett jämnt antal årstider. Fortfarande i Figur 5.11. Vikterna lagras i intervallet H3: H11. Denna formel returnerar det första centrerade glidande medlet, i cell I7: Den här formuläret returnerar 13.75. vilket är identiskt med värdet beräknat med den dubbelgenomsnittliga formeln i cell F7. Hänvisning till vikterna absolut, med dollartecken i H3: H11. Du kan kopiera formeln och klistra in den så långt som behövs för att få resten av de centrerade glidande medelvärdena. Avskaffande av serien med rörliga genomsnittsvärden När du har dragit bort de rörliga genomsnittsvärdena från de ursprungliga observationerna för att få de specifika årstiderna, har du tagit bort den underliggande trenden från serien. Vad8217s kvar i de specifika säsongerna är normalt en stillastående, horisontell serie med två effekter som gör att de specifika säsongerna avviker från en absolut rak linje: de säsongseffekter och slumpmässiga fel i de ursprungliga observationerna. Figur 5.12 visar resultaten för detta exempel. Figur 5.12 De specifika säsongseffekterna för fredag och lördag är tydliga i den avgränsade serien. Det övre diagrammet i Figur 5.12 visar de ursprungliga dagliga observationerna. Både den allmänna uppåtgående trenden och helgets säsongspinnar är tydliga. Nedre diagrammet visar de specifika säsongerna: Resultatet av att avbryta originalserien med ett rörligt genomsnittligt filter, som beskrivits tidigare i 8220Understående specifika säsongserier.8221 Du kan se att den avgränsade serien nu är nästan horisontell (en linjär trendlinje för de specifika säsongerna Har en liten nedåtgående drift), men säsongens fredag och lördagspikar är fortfarande på plats. Nästa steg är att flytta bortom säsongerna till säsongsindex. Se figur 5.13. Figur 5.13 De specifika säsongseffekterna förstvärderas och normaliseras sedan för att nå säsongsindexen. I Figur 5.13. De specifika säsongerna i kolumn E omordnas i tabellformen som visas i intervallet H4: N7. Syftet är helt enkelt att göra det enklare att beräkna säsongsvärdena. Dessa medelvärden visas i H11: N11. Men siffrorna i H11: N11 är medelvärden, inte avvikelser från ett genomsnitt, och därför kan vi inte förvänta dem att summera till noll. Vi behöver ändå justera dem så att de uttrycker avvikelser från ett stort medelvärde. Det stora medelvärdet framträder i cell N13, och är medelvärdet av säsongsmedelvärdena. Vi kan komma fram till säsongsindex genom att subtrahera den stora medelvärdet i N13 från varje säsongsmedel. Resultatet ligger i intervallet H17: N17. Dessa säsongsindex är inte längre specifika för ett visst rörligt medelvärde, vilket är fallet med de specifika säsongerna i kolumn E. Eftersom de8217re baseras på ett genomsnitt av varje förekomst av en given årstid, uttrycker de den genomsnittliga effekten av en given säsong över Fyra veckor i tidsserierna. Dessutom är de åtgärder för en säsong8217s8212 där, en dag8217s8212effekt på trafikarrestationer vis-224-vis genomsnittet för en sju dagarsperiod. Vi kan nu använda säsongsindex för att deseasonalisera serien. We8217ll använder deseasonalized-serien för att få prognoser genom linjär regression eller Holt8217s metod för utjämning av trendiga serier (diskuterad i kapitel 4). Sedan lägger vi helt enkelt säsongsindex tillbaka till prognoserna för att återställa dem. Allt detta framgår av Figur 5.14. Figur 5.14 Efter att du har säsongsindex, är de finjusteringar som tillämpas här detsamma som i metoden för enkla medelvärden. Stegen som illustreras i Figur 5.14 är i stor utsträckning densamma som i Figur 5.6 och 5.7. Diskuteras i följande avsnitt. Deseasonalizing the Observations Drasa säsongsindex från de ursprungliga observationerna för att deseasonalize data. Du kan göra det som visas i Figur 5.14. där de ursprungliga observationerna och säsongsindexen är ordnade som två listor som börjar i samma rad, kolumnerna C och F. Detta arrangemang gör det lite enklare att strukturera beräkningarna. Du kan också göra subtraktionen som visas i Figur 5.6. där de kvartalsvisa kvartalsobservationerna (C12: F16), de kvartalsvisa indexerna (C8: F8) och de desasonerade resultaten (C20: F24) visas i tabellformat. Det arrangemanget gör det lite lättare att fokusera på säsongsindex och de kvartalet kvartalsvisa. Prognos från Deseasonalized Observations I Figur 5.14. Deseasonalized observationer finns i kolumn H, och i Figur 5.7 de8217 i kolumn C. Oavsett om du vill använda en regressionsmetod eller en utjämning till prognosen, är it8217s bäst att ordna deseasonalized observationer i en enda kolumnlista. I figur 5.14. Prognoserna finns i kolumn J. Följande matrisformel anges i intervallet J2: J32. Tidigare i detta kapitel påpekade jag att om du släpper bort x-värdesargumentet från TREND () - funktionen8217s argument, levererar Excel standardvärdena 1. 2. n. där n är antalet y-värden. I den angivna formeln innehåller H2: H32 31 y-värden. Eftersom argumentet som normalt innehåller x-värdena saknas, levererar Excel standardvärdena 1. 2. 31. Det är de värden vi skulle vilja använda ändå i kolumn B, så formeln som given motsvarar TREND (H2: H32, B2: B32). Och that8217s strukturen som används i D5: D24 i Figur 5.7: Gör ett steg framåtprognos Så långt har du arrangerat prognoser för deseasonaliserade tidsserier från t 1 till t 31 i figur 5.14. och från t 1 till t 20 i figur 5.7. Dessa prognoser utgör användbar information för olika ändamål, inklusive bedömning av prognosernas noggrannhet med hjälp av en RMSE-analys. Men ditt huvudsakliga syfte är att prognosera åtminstone den nästa, ännu obemannade tidsperioden. För att få det kan du först prognosa från funktionen TREND () eller LINEST () om you8217re använder regression eller från exponentiell utjämningsformel om you8217re använder Holt8217s metod. Då kan du lägga till det associerade säsongsindexet till regressions - eller utjämningsprognosen, för att få en prognos som innehåller både trend och säsongseffekt. I figur 5.14. du får regressionsprognosen i cell J33 med denna formel: I denna formel är y-värdena i H2: H32 densamma som i de andra TREND () - formlerna i kolumn J. Så är (default) x-värdena på 1 Genom 32. Nu levererar du dock ett nytt x-värde som funktion8217s tredje argument, vilket du säger TREND () att leta efter i cell B33. It8217s 32. Nästa värde av t. Och Excel returnerar värdet 156.3 i cellen J33. Funktionen TREND () i cell J33 berättar Excel, i själva verket 8220 Beräkna regressionsekvationen för värdena i H2: H32 regresseras på t-värdena 1 till 31. Applicera den här regressionsekvationen till det nya x-värdet på 32 och returnera resultatet.8221 You8217ll hitta samma tillvägagångssätt som tagits i cell D25 i figur 5.7. Där formeln för att få en steg framåtprognos är detta: Lägga till säsongsindex igen. I det sista steget är att omvärdera prognoserna genom att lägga till säsongsindex för trendprognoserna och reversera vad du gjorde fyra steg tillbaka när du drog av Index från de ursprungliga observationerna. Detta görs i kolumn F i Figur 5.7 och kolumn K i Figur 5.14. Don8217t glömmer att lägga till det lämpliga säsongsindexet för prognosen med ett steg framåt, med resultaten som visas i cell F25 i Figur 5.7 och i cell K33 i Figur 5.14. (I8217ve skuggade de enstegsfria cellerna i både Figur 5.7 och Figur 5.14 för att markera prognoserna.) Du kan hitta diagram över tre representationer av trafikhäktningsdata i Figur 5.15. den decesasonalized serien, den linjära prognosen från deseasonalized data, och de reseasonalized prognoserna. Observera att prognoserna innehåller både den allmänna trenden för de ursprungliga uppgifterna och dess FridaySaturday spikes. Figur 5.15 Kartläggning av prognoserna.5.2 Utjämning av tidsserie Utjämning görs vanligtvis för att hjälpa oss att bättre se mönster, trender till exempel i tidsserier. Glatt ut den oregelbundna råheten i allmänhet för att se en tydligare signal. För säsongsdata kan vi sänka säsongsläget så att vi kan identifiera trenden. Utjämning ger oss inte en modell, men det kan vara ett bra första steg i att beskriva olika komponenter i serien. Termen filter används ibland för att beskriva ett utjämningsförfarande. Om exempelvis det jämnde värdet för en viss tid beräknas som en linjär kombination av observationer för omgivande tider kan det sägas att weve tillämpat ett linjärt filter på data (inte detsamma som att säga att resultatet är en rak linje, genom att vägen). Den traditionella användningen av begreppet glidande medelvärde är att vid varje tidpunkt bestämmer vi (möjligen viktade) medelvärden av observerade värden som omger en viss tid. Till exempel vid tid t. ett centrerat rörligt medelvärde av längd 3 med lika vikter skulle vara medelvärdet av värden vid tider t -1. T. och t1. För att ta bort säsongsscenarier från en serie, så vi bättre kan se trenden, skulle vi använda ett glidande medelvärde med en längd säsongsspann. Således har i de släta serierna varje utjämnat värde varit medelvärde över alla årstider. Detta kan göras genom att titta på ett ensidigt glidande medelvärde där du i genomsnitt alla värden för tidigare år värderade data eller ett centrerat glidande medelvärde där du använder värden både före och efter aktuell tid. För kvartalsdata kan vi till exempel definiera ett jämnt värde för tiden t som (x t x t-1 x t-2 x t-3) 4, genomsnittet av den här tiden och de föregående 3 kvartalen. I R-kod kommer detta att vara ett ensidigt filter. Ett centrerat glidande medelvärde skapar lite svårighet när vi har ett jämnt antal tidsperioder under säsongsspannet (som vi brukar göra). Att släpa säsongen i kvartalsdata. För att identifiera trenden är den vanliga konventionen att använda det glidande medlet jämnas vid tidpunkten t. För att släta säsongen i månadsdata. För att identifiera trenden är den vanliga konventionen att använda det glidande medlet glatt vid tidpunkt t. Det vill säga, vi applicerar vikt 124 till värden ibland t6 och t6 och vikt 112 till alla värden vid alla tidpunkter mellan t5 och t5. I R-filterkommandot anger du ett tvåsidigt filter när vi vill använda värden som kommer både före och efter tiden för utjämning. Observera att på sidan 71 i vår bok gäller författarna lika vikter över ett centrerat säsongsmässigt glidande medelvärde. Det är okej också. Exempelvis kan en kvartalsmjukare glättas vid tidpunkten t är frac x frac x frac xt frac x frac x En månatlig mjukare kan tillämpa en vikt av 113 till alla värden från tiderna t-6 till t6. Koden som författarna använder på sidan 72 utnyttjar ett rep-kommando som upprepar ett värde ett visst antal gånger. De använder inte filterparametern inom filterkommandot. Exempel 1 Kvartals ölproduktion i Australien I både lektion 1 och lektion 4 tittade vi på en serie kvartalsvis ölproduktion i Australien. Den följande R-koden skapar en jämn serie som låter oss se trendmönstret och plottar detta trendmönster på samma graf som tidsserien. Det andra kommandot skapar och lagrar den släta serien i objektet som kallas trendpattern. Observera att det i filterkommandot ger det parametervärde filtret koefficienterna för utjämningen och sidor 2 gör att en centrerad smidig kan beräknas. ölprodskanning (beerprod. dat) trendpatternfilter (ölprod, filter c (18, 14, 14, 14, 18), sidor2) plot (ölprod, typ b, huvudrörande genomsnittliga årliga trend) linjer (trendpattern) Heres resultatet: Vi kan subtrahera trendmönstret från datavärdena för att få en bättre titt på säsongsalder. Heres hur det skulle bli gjort: seasonals beerprod - trendpattern plot (säsonger, typ b, huvudsäsongsmönster för ölproduktion) Resultatet följer: En annan möjlighet att utjämna serier för att se trenden är ettsidigt filter trendpattern2 filter (ölprod, filter c (14, 14, 14, 14), sidor1) Med detta är det släta värdet genomsnittet för det gångna året. Exempel 2 USA: s månatliga arbetslöshet I läxan för vecka 4 såg du på en månadsserie arbetslöshet i USA för 1948-1978. Här är en utjämning gjord för att titta på trenden. trendunemployfilter (arbetslös, filterc (124,112,112,112,112,112,112,112,112,112,112,112,124), sidor2) trendunemploy ts (trendunemploy, start c (1948,1), freq 12) plot (trendunemploy, mainTrend i arbetslöshet i USA, 1948-1978, xlab Year) Endast den släta trenden är planerad. Det andra kommandot identifierar kalendertidsegenskaperna för serien. Det gör att tomten har en mer meningsfull axel. Grunden följer. För serier som inte är säsongsbundna, är det inte säkert att du släpper över någon viss spänn. För utjämning bör du experimentera med glidande medelvärden av olika spänner. Dessa spänner över tiden kan vara relativt korta. Målet är att slå av de grova kanterna för att se vilken trend eller mönster som kan vara där. Andra utjämningsmetoder (avsnitt 2.4) Avsnitt 2.4 beskriver flera sofistikerade och användbara alternativ för att flytta genomsnittlig utjämning. Detaljerna kan verka sketchy, men det är okej för att vi inte vill komma ner i massor av detaljer för dessa metoder. Av de alternativa metoder som beskrivs i avsnitt 2.4 kan lowess (lokalt viktad regression) vara den mest använda. Exempel 2 Fortsatt Följande diagram är en jämn trendlinje för USA: s arbetslöshetsserie, som användes med en lågare mjukare, i vilken en betydande mängd (23) bidrog till varje jämn uppskattning. Observera att detta slätte serien mer aggressivt än det glidande medlet. De kommandon som användes var arbetslösa ts (arbetslös, start c (1948,1), freq12) plot (lowess (arbetslös, f 23), främsta Lowess-utjämning av USA: s arbetslöshetstendens) Enkel exponentiell utjämning Den grundläggande prognosekvationen för enkel exponentiell utjämning är ofta given som hatt alfa xt (1-alfa) hat t-text Vi förutspår värdet av x vid tid t1 för att vara en viktad kombination av det observerade värdet vid tid t och det prognostiserade värdet vid tiden t. Även om metoden kallas en utjämningsmetod används den huvudsakligen för prognoser på kort sikt. Värdet av kallas utjämningskonstanten. Oavsett anledning är 0,2 ett populärt standardprogramval. Detta lägger en vikt på .2 på den senaste observationen och en vikt på 1,2 .8 på den senaste prognosen. Med ett relativt litet värde kommer utjämningen att bli relativt mer omfattande. Med ett relativt stort värde är utjämningen relativt mindre omfattande, eftersom mer vikt kommer att sättas på det observerade värdet. Det här är en enkel prognosmetod med ett steg framåtblickande som vid första anblicken inte verkar ha behov av en modell för data. Faktum är att denna metod motsvarar användningen av en ARIMA (0,1,1) modell utan konstant. Det optimala förfarandet är att passa en ARIMA (0,1,1) modell till det observerade datasetet och använda resultaten för att bestämma värdet på. Det här är optimalt i den meningen att det bäst ska skapas för de data som redan observerats. Även om målet är utjämning och ett steg framåt prognoser, motsvarar likvärdigheten till ARIMA (0,1,1) modellen en bra punkt. Vi bör inte blint använda exponentiell utjämning eftersom den underliggande processen kanske inte är välmodellerad av en ARIMA (0,1,1). ARIMA (0,1,1) och exponentiell utjämningsekvivalens Tänk på en ARIMA (0,1,1) med medelvärdet 0 för de första skillnaderna, xt - x t-1: starthatt amp amp xt theta1 wt amp amp xt theta1 (xt - som t) amp amp (1 theta1) xt-theta1hat tenderar. Om vi låter (1 1) och därmed - (1) 1, ser vi ekvivalensen till ekvation (1) ovan. Varför metoden kallas exponentiell utjämning Detta ger följande: starthatt amp amp alpha xt (1-alfa) alfa x (1-alfa) hatt amp amp alpha xt alfa (1-alfa) x (1-alfa) 2hat än Fortsätt På detta sätt genom successivt att ersätta det prognostiserade värdet på ekvations högra sida. Detta leder till: hatt alfa xt alfa (1-alfa) x alfa (1-alfa) 2 x prick alfa (1-alfa) jx prick alfa (1-alfa) x1 text ekvation 2 visar att det prognostiserade värdet är ett vägt genomsnitt av alla tidigare värden i serien, med exponentiellt förändrade vikter när vi flyttar tillbaka i serien. Optimal exponentiell utjämning i R I grund och botten passar vi bara en ARIMA (0,1,1) till data och bestämmer koefficienten. Vi kan undersöka passformen för den smidiga genom att jämföra de förutsagda värdena till den aktuella serien. Exponentiell utjämning tenderar att användas mer som ett prognosverktyg än en riktigt jämnare, så letade efter att se om vi har en bra passform. Exempel 3 n 100 månatliga observationer av logaritmen för ett oljeprisindex i USA. Dataserien är: En ARIMA (0,1,1) passning i R gav en MA (1) - koefficient 0,3877. Således (11) 1,3877 och 1--0,3877. Exponential utjämning prognos ekvationen är hatt 1.3877xt - 0.3877hat t Vid tiden 100 är det observerade värdet av serien x 100 0.86601. Det förutspådda värdet för serien vid den tiden är sålunda prognosen för tid 101 är hatten 1.3877x - 0.3877hat 1.3877 (0.86601) -0.3877 (0.856789) 0.8696 Följande är hur bra den smidigare passar serien. Det är en bra passform. Det är ett gott tecken på prognoser, det huvudsakliga syftet med detta är smidigare. Här är kommandon som används för att generera produktionen för det här exemplet: oilindex scan (oildata. dat) plot (oilindex, typ b, Main Log of Oil Index Series) expsmoothfit arima (oilindex, order c (0,1,1)) expsmoothfit För att se arima resultat förutsäger oilindex - expsmoothfitresiduals predicted values plot (oilindex, typeb, huvudexponentiell utjämning av log of oil index) linjer (förutsägda) 1.3877oilindex100-0.3877predicteds100 prognos för tid 101 Dubbel exponentiell utjämning Dubbel exponentiell utjämning kan användas när theres Trend (antingen långsiktig eller kort sikt), men ingen säsongsmässighet. I huvudsak skapar metoden en prognos genom att kombinera exponentiellt jämnade uppskattningar av trenden (lutning av en rak linje) och nivån (i princip avlyssningen av en rak linje). Två olika vikter eller utjämningsparametrar används för att uppdatera dessa två komponenter vid varje tillfälle. Den jämnda nivån är mer eller mindre ekvivalent med en enkel exponentiell utjämning av datavärdena och den släta trenden är mer eller mindre lika med en enkel exponentiell utjämning av de första skillnaderna. Proceduren motsvarar montering av en ARIMA (0,2,2) modell, utan konstant kan den utföras med en ARIMA (0,2,2) passform. (1-B) 2x (1theta1B theta2B2) vikt. Navigering
No comments:
Post a Comment