O alisamento exponencial pesa observações passadas com pesos exponencialmente decrescentes para prever valores futuros. Este esquema de alisamento começa pela definição de (S2) a (y1), onde (Si) significa observação suavizada ou EWMA e (y) representa a observação original. Os índices referem-se aos períodos de tempo, (1,, 2,, ldots,, n). Para o terceiro período, (S3 alfa y2 (1-alfa) S2) e assim por diante. Não existe (S1) a série suavizada começa com a versão suavizada da segunda observação. Para qualquer período de tempo (t), o valor alisado (St) é encontrado calculando St alfa y (1-alfa) S ,,,,,, 0 0 Equação expandida para (S5) Por exemplo, a equação expandida para o alisado (S5) é: S5 alfa esquerdo (1-alfa) 0 y (1-alfa) 1 y (1-alfa) 2 y direito (1-alfa) 3 S2. Ilustra comportamento exponencial Isso ilustra o comportamento exponencial. Os pesos, (alfa (alfa) t) diminuem geometricamente, e sua soma é a unidade como mostrado abaixo, usando uma propriedade de séries geométricas: alfa suma (1-alfa) i alfa esquerda frac direita 1 - (1-alfa) T. A partir da última fórmula podemos ver que o termo de soma mostra que a contribuição para o valor suavizado (St) torna-se menor em cada período de tempo consecutivo. Exemplo para (alfa 0,3) Let (alfa 0,3). Observe que os pesos (alfa (1-alfa) t) diminuem exponencialmente (geometricamente) com o tempo. A soma dos erros quadrados (SSE) 208.94. A média dos erros quadrados (MSE) é a SSE 11 19.0. Calcular para diferentes valores de (alfa) O MSE foi novamente calculado para (alfa 0,5) e acabou por ser 16,29, então neste caso nós preferimos um (alfa) de 0,5. Podemos fazer melhor Podemos aplicar o comprovado método de tentativa e erro. Este é um procedimento iterativo começando com um intervalo de (alfa) entre 0,1 e 0,9. Determinamos a melhor escolha inicial para (alfa) e depois procuramos entre (alfa - Delta) e (alfa Delta). Poderíamos repetir isso talvez mais uma vez para encontrar o melhor (alfa) a 3 casas decimais. Otimizadores não-lineares podem ser usados Mas há melhores métodos de busca, como o procedimento Marquardt. Este é um otimizador não-linear que minimiza a soma dos quadrados dos resíduos. Em geral, a maioria dos programas de software estatísticos bem concebidos deve ser capaz de encontrar o valor de (alfa) que minimiza o MSE. Amostra de gráfico mostrando dados suavizados para 2 valores de (alfa) Excel Para Análise de Dados Estatísticos Este é um site companheiro de webtext de Business Statistics USA Site: Site Espejo para Amrica Latina Sitio de los EEUU Excel é o pacote estatístico amplamente utilizado, que serve como uma ferramenta para compreender conceitos estatísticos e computação para verificar seu cálculo trabalhado manualmente na resolução de seus problemas de lição de casa. O site fornece uma introdução para compreender os conceitos básicos e trabalhar com o Excel. Refazer os exemplos numéricos ilustrados neste site ajudará a melhorar sua familiaridade e, como resultado, aumentar a eficácia e eficiência de seu processo em estatísticas. Para pesquisar o site. Tente E dit F ind na página Ctrl f. Digite uma palavra ou frase na caixa de diálogo, p. Quot variancequot ou quot meanquot Se o primeiro aparecimento da palavra-frase não for o que você está procurando, tente F ind. Introdução Este site fornece experiência ilustrativa no uso do Excel para resumo de dados, apresentação e para outras análises estatísticas básicas. Acredito que o uso popular do Excel está nas áreas em que o Excel realmente pode se destacar. Isso inclui a organização de dados, ou seja, gerenciamento de dados básicos, tabulação e gráficos. Para a análise estatística real sobre deve aprender usando os pacotes profissionais comerciais estatísticas, como SAS e SPSS. O Microsoft Excel 2000 (versão 9) fornece um conjunto de ferramentas de análise de dados chamado Analysis ToolPak que você pode usar para salvar etapas quando você desenvolve análises estatísticas complexas. Você fornece os dados e parâmetros para cada análise a ferramenta usa as funções de macro estatísticas apropriadas e exibe os resultados em uma tabela de saída. Algumas ferramentas geram gráficos além de tabelas de saída. Se o comando Análise de dados for selecionável no menu Ferramentas, o Analysis ToolPak será instalado no sistema. No entanto, se o comando Análise de dados não estiver no menu Ferramentas, você precisará instalar o Analysis ToolPak fazendo o seguinte: Etapa 1: No menu Ferramentas, clique em Suplementos. Se o Analysis ToolPak não estiver listado na caixa de diálogo Add-Ins, clique em Procurar e localize a unidade, o nome da pasta e o nome do arquivo para o Analysis ToolPak Add-in Analys32.xll normalmente localizado na pasta Program FilesMicrosoft OfficeOfficeLibraryAnalysis. Depois de encontrar o arquivo, selecione-o e clique em OK. Etapa 2: Se você não encontrar o arquivo Analys32.xll, então você deve instalá-lo. Insira o disco 1 do Microsoft Office 2000 na unidade de CD-ROM. Selecione Executar no menu Iniciar do Windows. Procure e selecione a unidade para o seu CD. Selecione Setup. exe, clique em Abrir e clique em OK. Clique no botão Adicionar ou remover funcionalidades. Clique no próximo para o Microsoft Excel para Windows. Clique no próximo para Add-ins. Clique na seta para baixo junto ao Analysis ToolPak. Selecione Executar a partir do meu computador. Selecione o botão Atualizar agora. O Excel agora atualizará seu sistema para incluir o Analysis ToolPak. Inicie o Excel. No menu Ferramentas, clique em Suplementos. - e selecione a caixa de seleção Analysis ToolPak. Etapa 3: O Analysis ToolPak Add-In agora está instalado e Análise de Dados. Agora será selecionável no menu Tools. Microsoft Excel é um pacote de planilha poderoso disponível para Microsoft Windows eo Apple Macintosh. O software de planilha é usado para armazenar informações em colunas e linhas que podem então ser organizadas e / ou processadas. As planilhas são projetadas para funcionar bem com números, mas geralmente incluem texto. Excel organiza seu trabalho em pastas de trabalho cada pasta de trabalho pode conter várias planilhas planilhas são usadas para lista e analisar dados. O Excel está disponível em todos os PCs de acesso público (isto é, aqueles, por exemplo, na Biblioteca e PC Labs). Ele pode ser aberto selecionando Iniciar - Programas - Microsoft Excel ou clicando no Excel Short Cut que está no seu desktop, ou em qualquer PC, ou na barra de ferramentas do Office. Abrir um Documento: Clique em Arquivo-Abrir (CtrlO) para abrir uma pasta de trabalho existente. Altere a área ou unidade do diretório para procurar arquivos em outros locais. Para criar uma nova pasta de trabalho, clique em Arquivo Novo Documento em branco. Salvando e fechando um documento: Para salvar o documento com seu nome de arquivo atual, local e formato de arquivo, clique em Arquivo - Salvar. Se você estiver salvando pela primeira vez, clique em Salvar arquivo, escolha um nome para o documento e clique em OK. Também use File-Save se você quiser salvar em uma filenamelocation diferente. Quando você terminar de trabalhar em um documento, você deve fechá-lo. Vá para o menu Arquivo e clique em Fechar. Se tiver feito alterações desde que o arquivo foi salvo pela última vez, será perguntado se deseja salvá-las. A tela Excel Workbooks e planilhas: Quando você inicia o Excel, uma planilha em branco é exibida, que consiste em uma grade múltipla de células com linhas numeradas na página e colunas com o título alfabético em toda a página. Cada c�lula � referenciada pelas suas coordenadas (por exemplo, A3 � utilizado para referir a c�lula na coluna A e linha 3 B10: B20 � utilizado para referir o intervalo de c�lulas na coluna B e linhas 10 a 20). Seu trabalho é armazenado em um arquivo do Excel chamado de pasta de trabalho. Cada pasta de trabalho pode conter várias planilhas e / ou gráficos - a planilha atual é chamada de planilha ativa. Para exibir uma planilha diferente em uma pasta de trabalho, clique na guia Folha apropriada. Você pode acessar e executar comandos diretamente do menu principal ou você pode apontar para um dos botões da barra de ferramentas (a caixa de exibição que aparece abaixo do botão, quando você coloca o cursor sobre ele, indica a ação do nome do botão) e clique uma vez. Movendo-se ao redor da planilha: É importante ser capaz de mover-se ao redor da planilha efetivamente porque você só pode inserir ou alterar dados na posição do cursor. Você pode mover o cursor usando as teclas de seta ou movendo o mouse para a célula desejada e clicando em. Uma vez selecionada a célula torna-se a célula ativa e é identificada por uma borda grossa apenas uma célula pode estar ativa por vez. Para mover de uma planilha para outra, clique nos separadores de folha. (Se a pasta de trabalho contiver várias folhas, clique com o botão direito do mouse nos botões de rolagem da aba e, em seguida, clique na folha desejada.) O nome da folha ativa é mostrado em negrito. Movendo entre as células: Aqui estão os atalhos de teclado para mover a célula ativa: Início - move para a primeira coluna da linha atual CtrlHome - move para o canto superior esquerdo do documento Fim, em seguida, Início - move para a última célula do documento Para Mover entre células em uma planilha, clique em qualquer célula ou use as teclas de seta. Para ver uma área diferente da folha, use as barras de rolagem e clique nas setas ou na área acima embaixo da caixa de rolagem nas barras de rolagem verticais ou horizontais. Observe que o tamanho de uma caixa de rolagem indica a quantidade proporcional da área usada da folha que está visível na janela. A posição de uma caixa de deslocamento indica a localização relativa da área visível dentro da folha de cálculo. Inserindo dados Uma nova planilha é uma grade de linhas e colunas. As linhas são rotuladas com números e as colunas são rotuladas com letras. Cada interseção de uma linha e uma coluna é uma célula. Cada célula tem um endereço. Que é a letra da coluna e o número da linha. A seta na planilha à direita aponta para a célula A1, que está actualmente realçada. Indicando que é uma célula ativa. Uma célula deve estar ativa para inserir informações nele. Para destacar (selecionar) uma célula, clique nele. Para selecionar mais de uma célula: Clique em uma célula (por exemplo, A1) e mantenha pressionada a tecla Shift enquanto clica em outra (por exemplo, D4) para selecionar todas as células entre A1 e D4. Clique em uma célula (por exemplo, A1) e arraste o mouse pelo intervalo desejado, clicando noutra célula (por exemplo, D4) para selecionar todas as células entre e incluindo A1 e D4.Para selecionar várias células que não estão adjacentes, pressione o controle e clique em As células que você deseja selecionar. Clique em um número ou letra rotulando uma linha ou coluna para selecionar toda a linha ou coluna. Uma planilha pode ter até 256 colunas e 65.536 linhas, assim itll ser um tempo antes de você ficar sem espaço. Cada célula pode conter um rótulo. valor . Valor lógico. Ou fórmula. As etiquetas podem conter qualquer combinação de letras, números ou símbolos. Os valores são números. Somente valores (números) podem ser usados nos cálculos. Um valor também pode ser uma data ou um timeLogical valores são true ou false. Formulas automaticamente fazer cálculos sobre os valores em outras células especificadas e exibir o resultado na célula na qual a fórmula é inserida (por exemplo, você pode especificar que a célula D3 É para conter a soma dos números em B3 e C3 o número exibido em D3 será então uma função dos números inseridos em B3 e C3). Para inserir informações em uma célula, selecione a célula e comece a digitar. Observe que, à medida que você digita informações na célula, as informações inseridas também são exibidas na barra de fórmulas. Você também pode inserir informações na barra de fórmulas e as informações aparecerão na célula selecionada. Quando terminar de digitar o rótulo ou valor: Pressione Enter para mover para a próxima célula abaixo (neste caso, A2) Pressione Tab para mover para a próxima célula à direita (neste caso, B1) Clique em qualquer célula para selecionar Introduzir etiquetas A menos que as informações introduzidas sejam formatadas como um valor ou uma fórmula, o Excel irá interpretá-lo como um rótulo e predefinido para alinhar o texto no lado esquerdo da célula. Se você estiver criando uma planilha longa e você estará repetindo as mesmas informações de rótulo em várias células diferentes, você pode usar a função AutoCompletar. Esta função analisará outras entradas na mesma coluna e tentará corresponder a uma entrada anterior com a entrada atual. Por exemplo, se você já tiver digitado Wesleyan em outra célula e digitar W em uma nova célula, o Excel entrará automaticamente Wesleyan. Se você pretende digitar Wesleyan na célula, sua tarefa é feita, e você pode passar para a próxima célula. Se pretender escrever algo mais, por ex. Williams, para a célula, basta continuar digitando para inserir o termo. Para ativar a função AutoCompletar, clique em Ferramentas na barra de menu, selecione Opções, selecione Editar e clique para colocar uma marca na caixa ao lado de Ativar preenchimento automático para valores de célula. Outra maneira de inserir rapidamente rótulos repetidos é usar o recurso Lista de seleção. Clique com o botão direito do mouse em uma célula e selecione Selecionar da lista. Isso lhe dará um menu de todas as outras entradas nas células dessa coluna. Clique em um item no menu para inseri-lo na célula selecionada atualmente. Um valor é um número, data ou hora, mais alguns símbolos, se necessário, para definir ainda mais os números 91 tais como. - () 93. Considera-se que os números são positivos para introduzir um número negativo, utilize um sinal de menos - ou coloque o número entre parênteses (). As datas são armazenadas como MMDDYYYY, mas você não precisa inseri-lo precisamente nesse formato. Se você digitar jan 9 ou jan-9, Excel reconhecê-lo em 9 de janeiro do ano atual e armazená-lo como 192002. Insira o ano de quatro dígitos para um ano diferente do ano atual (por exemplo, 9 de janeiro de 1999). Para introduzir a data actual, prima o controlo e ao mesmo tempo. Times padrão para um relógio de 24 horas. Use a ou p para indicar am ou pm se você usar um relógio de 12 horas (por exemplo 8:30 p é interpretado como 8:30 PM). Para inserir a hora atual, pressione o controle e: (shift-ponto-e-vírgula) ao mesmo tempo. Uma entrada interpretada como um valor (número, data ou hora) é alinhada para o lado direito da célula, para reformatar um valor. Arredondamento de números que atendam aos critérios especificados: Para aplicar cores aos valores máximo e mínimo: Selecione uma célula na região e pressione CtrlShift (no Excel 2003, pressione este ou CtrlA) para selecionar a região atual. No menu Formatar, selecione Formatação condicional. Na condição 1, selecione Fórmula Is e digite MAX (F: F) F1. Clique em Formatar, selecione a guia Fonte, selecione uma cor e clique em OK. Na condição 2, selecione Fórmula Is e digite MIN (F: F) F1. Repita o passo 4, seleccione uma cor diferente do que seleccionou para Condição 1, e em seguida, clique em OK. Nota: Certifique-se de fazer a distinção entre referência absoluta e referência relativa ao digitar as fórmulas. Números arredondados que atendem aos critérios especificados Problema: Arredondando todos os números na coluna A para zero casas decimais, exceto aqueles que têm 5 na primeira casa decimal. Solução: Use as funções IF, MOD e ROUND na fórmula a seguir: IF (MOD (A2,1) 0,5, A2, ROUND (A2,0)) Para copiar e colar todas as células em uma folha Selecione as células na folha Pressionando CtrlA (no Excel 2003, selecione uma célula em uma área em branco antes de pressionar CtrlA ou de uma célula selecionada em um Current RegionList intervalo, pressione CtrlAA). OU Clique em Selecionar tudo na interseção superior esquerda de linhas e colunas. Pressione CtrlC. Pressione CtrlPage Down para selecionar outra planilha e, em seguida, selecione a célula A1. Pressione Enter. Para copiar a planilha inteira Copiar a folha inteira significa copiar as células, os parâmetros de configuração da página e os nomes de intervalo definidos. Opção 1: mova o ponteiro do mouse para uma guia de planilha. Pressione Ctrl e segure o mouse para arrastar a folha para um local diferente. Solte o botão do mouse ea tecla Ctrl. Opção 2: Clique com o botão direito do mouse na guia da folha apropriada. No menu de atalho, selecione Mover ou Copiar. A caixa de diálogo Mover ou Copiar permite copiar a folha para um local diferente na pasta de trabalho atual ou para uma pasta de trabalho diferente. Certifique-se de marcar a caixa de seleção Criar uma cópia. Opção 3: No menu Janela, selecione Organizar. Selecione Tile para colocar todas as pastas de trabalho abertas na janela. Use a Opção 1 (arrastando a folha enquanto pressiona Ctrl) para copiar ou mover uma folha. Ordenação por Colunas A configuração padrão para classificação em Ordem Ascendente ou Decrescente é por linha. Para classificar por colunas: No menu Dados, selecione Classificar e, em seguida, Opções. Selecione o botão de opção Classificar para a esquerda para a direita e clique em OK. Na opção Ordenar por na caixa de diálogo Classificar, selecione o número da linha pela qual as colunas serão classificadas e clique em OK. Estatísticas Descritivas O ToolPak de Análise de Dados possui uma ferramenta Descritiva de Estatísticas que fornece uma maneira fácil de calcular estatísticas de resumo de um conjunto de dados de amostra. As estatísticas de resumo incluem Média, Erro Padrão, Mediana, Modo, Desvio Padrão, Variância, Curtose, Inclinação, Faixa, Mínimo, Máximo, Soma e Contagem. Esta ferramenta elimina a necessidade de digitar funções indivividual para encontrar cada um desses resultados. Excel inclui barras de ferramentas elaboradas e personalizáveis, por exemplo, a barra de ferramentas padrão mostrada aqui: Alguns dos ícones são computação matemática útil: é o ícone Autosum, que insere a fórmula sum () para adicionar um intervalo de células. É o ícone FunctionWizard, que lhe dá acesso a todas as funções disponíveis. É o ícone GraphWizard, que dá acesso a todos os tipos de gráficos disponíveis, como mostrado nesta tela: Excel pode ser usado para gerar medidas de localização e variabilidade para uma variável. Suponha que desejamos encontrar estatísticas descritivas para uma amostra de dados: 2, 4, 6 e 8. Etapa 1. Selecione o menu suspenso Ferramentas, se você ver a análise de dados, clique nessa opção, caso contrário, clique em add-in . Opção para instalar a ferramenta de análise pak. Etapa 2. Clique na opção de análise de dados. Etapa 3. Selecione Estatísticas descritivas na lista Ferramentas de análise. Etapa 4. Quando a caixa de diálogo aparecer: Digite A1: A4 na caixa de intervalo de entrada, A1 é um valor na coluna A ea linha 1. Neste caso, este valor é 2. Usando a mesma técnica entrar outros VALUES até chegar ao último. Se um exemplo consiste em 20 números, você pode selecionar, por exemplo, A1, A2, A3, etc. como o intervalo de entrada. Etapa 5. Selecione um intervalo de saída. Neste caso B1. Clique em estatísticas de resumo para ver os resultados. Quando você clique OK. Você verá o resultado no intervalo selecionado. Como você verá, a média da amostra é 5, a mediana é 5, o desvio padrão é 2,581989, a variância da amostra é 6,6666667, o intervalo é 6 e assim por diante. Cada um desses fatores pode ser importante no cálculo de diferentes procedimentos estatísticos. Distribuição Normal Considere o problema de encontrar a probabilidade de obter menos de um certo valor sob qualquer distribuição de probabilidade normal. Como um exemplo ilustrativo, suponhamos que os escores SAT em todo o país são normalmente distribuídos com uma média e desvio padrão de 500 e 100, respectivamente. Responda às seguintes perguntas com base nas informações fornecidas: A: Qual é a probabilidade de uma pontuação de um aluno selecionada aleatoriamente ser menor que 600 pontos? B: Qual é a probabilidade de uma pontuação de um aluno selecionada aleatoriamente exceder 600 pontos C: Qual é a probabilidade Que uma pontuação de alunos selecionados aleatoriamente será entre 400 e 600 Dica: Usando o Excel você pode encontrar a probabilidade de obter um valor aproximadamente menor ou igual a um determinado valor. Em um problema, quando a média eo desvio padrão da população são dadas, você tem que usar o senso comum para encontrar diferentes probabilidades com base na pergunta, pois você sabe que a área sob uma curva normal é 1. Na folha de trabalho, selecione a Onde deseja que a resposta apareça. Suponha que você escolheu a célula número um, A1. Nos menus, selecione quotinsert pull-downquot. Etapas 2-3 Nos menus, selecione inserir e, em seguida, clique na opção Função. Etapa 4. Depois de clicar na opção Função, a caixa de diálogo Função de Pasta aparece de Categoria de Função. Escolha Estatística e NORMDIST a partir da caixa Nome da Função Clique em OK Etapa 5. Depois de clicar em OK, a caixa de distribuição NORMDIST aparece: i. Insira 600 em X (a caixa de valor) ii. Insira 500 na caixa Média iii. Insira 100 na caixa Desvio Padrão iv. Digite quottruequot na caixa cumulativa e clique em OK. Como você vê o valor 0.84134474 aparece em A1, indicando a probabilidade de que uma pontuação de alunos selecionados aleatoriamente é inferior a 600 pontos. Usando o senso comum, podemos responder parte quotbquot subtraindo 0.84134474 de 1. Assim, a parte quotbquot resposta é 1- 0.8413474 ou 0.158653. Esta é a probabilidade de que uma pontuação de alunos selecionados aleatoriamente seja maior que 600 pontos. Para responder parte quotcquot, use as mesmas técnicas para encontrar as probabilidades ou área no lado esquerdo dos valores 600 e 400. Uma vez que estas áreas ou probabilidades sobrepõem uns aos outros para responder a pergunta que você deve subtrair a menor probabilidade de maior probabilidade. A resposta é igual a 0,84134474 - 0,15865526 ou seja, 0,68269. A captura de tela deve se parecer com a seguinte: Cálculo do valor de uma variável aleatória freqüentemente chamada de valor quotxquot Você pode usar NORMINV a partir da caixa de função para calcular um valor para a variável aleatória - se a probabilidade para o lado esquerdo dessa variável for dada. Na verdade, você deve usar esta função para calcular diferentes percentis. Neste problema, pode-se perguntar qual é a pontuação de um aluno cujo percentil é 90 Isto significa que aproximadamente 90 das pontuações dos alunos são inferiores a este número. Por outro lado, se tivéssemos que fazer este problema manualmente, teríamos de calcular o valor x usando a fórmula de distribuição normal x m zd. Agora vamos usar o Excel para calcular P90. Na função Colar, clique em diálogo estatístico e, em seguida, clique em NORMINV. A captura de tela seria semelhante à seguinte: Quando você vê NORMINV a caixa de diálogo aparece. Eu. Insira 0.90 para a probabilidade (isto significa que aproximadamente 90 dos alunos pontuação é menor do que o valor que estamos procurando) ii. Digite 500 para a média (esta é a média da distribuição normal no nosso caso) iii. Digite 100 para o desvio padrão (este é o desvio padrão da distribuição normal no nosso caso) No final desta tela você verá o resultado da fórmula que é de aproximadamente 628 pontos. Isso significa que o top 10 dos alunos obteve melhores resultados do que 628. Intervalo de confiança para a média Suponha que desejamos estimar um intervalo de confiança para a média de uma população. Dependendo do tamanho do seu tamanho de amostra, você pode usar um dos seguintes casos: Grande Tamanho da Amostra (n é maior que, digamos 30): A fórmula geral para desenvolver um intervalo de confiança para uma população significa: Nesta fórmula é a média Da amostra Z é o coeficiente de intervalo, que pode ser encontrado a partir da tabela de distribuição normal (por exemplo, o coeficiente de intervalo para um nível de confiança de 95 é 1,96). S é o desvio padrão da amostra e n é o tamanho da amostra. Agora, gostaríamos de mostrar como o Excel é usado para desenvolver um certo intervalo de confiança de uma média populacional com base em uma amostra de informações. Como você vê, a fim de avaliar esta fórmula você precisa quotthe média do samplequot ea margem de erro Excel irá calcular automaticamente essas quantidades para você. As únicas coisas que você precisa fazer são: adicionar a margem de erro à média da amostra, encontrar o limite superior do intervalo e subtrair a margem de erro da média para o limite inferior do intervalo. Para demonstrar como o Excel encontra essas quantidades vamos usar o conjunto de dados, que contém a renda horária de 36 estudantes de trabalho-estudo aqui, na Universidade de Baltimore. Esses números aparecem nas células A1 a A36 em uma planilha do Excel. Após a entrada dos dados, seguimos o procedimento estatístico descritivo para calcular as quantidades desconhecidas. A única etapa adicional é clicar no intervalo de confiança na caixa de diálogo estatística descritiva e digitar o nível de confiança dado, neste caso 95. Aqui está, os procedimentos acima em passo a passo: Passo 1. Digite os dados nas células A1 Para A36 (na planilha) Etapa 2. Nos menus selecione Ferramentas Etapa 3. Clique em Análise de Dados e, em seguida, escolha a opção Estatísticas Descritivas e clique em OK. Na caixa de diálogo de estatísticas descritivas, clique em Estatística de Resumo. Depois de ter feito isso, clique no nível de intervalo de confiança e digite 95 - ou em outros problemas qualquer intervalo de confiança que você deseja. Na caixa Output Range digite B1 ou o local que você deseja. Agora clique em OK. A captura de tela seria semelhante à seguinte: Como você vê, a planilha mostra que a média da amostra é 6.902777778 eo valor absoluto da margem de erro 0.231678109. Esta média é baseada nestas informações de exemplo. Um intervalo de confiança de 95 para o rendimento horário dos estudantes de trabalho-estudo da UB tem um limite superior de 6.902777778 0.231678109 e um limite inferior de 6.902777778 - 0.231678109. Por outro lado, podemos dizer que de todos os intervalos formados desta forma 95 contém a média da população. Ou, para fins práticos, podemos estar 95 confiantes de que a média da população está entre 6.902777778 - 0.231678109 e 6.902777778 0.231678109. Podemos estar pelo menos 95 confiantes de que intervalo 6.68 e 7.13 contém a renda média por hora de um estudante de trabalho-estudo. Tamanho da Amostra Smal (digamos menos de 30) Se a amostra n for menor que 30 ou devemos usar o pequeno procedimento de amostra para desenvolver um intervalo de confiança para a média de uma população. A fórmula geral para o desenvolvimento de intervalos de confiança para a média da população com base em pequena amostra é: Nesta fórmula é a média da amostra. É o coeficiente de intervalo que fornece uma área de na parte superior de uma distribuição t com n-1 graus de liberdade que pode ser encontrado a partir de uma tabela de distribuição t (por exemplo, o coeficiente de intervalo para um nível de confiança de 90 é 1.833 se a amostra for 10). S é o desvio padrão da amostra e n é o tamanho da amostra. Agora você gostaria de ver como o Excel é usado para desenvolver um certo intervalo de confiança de uma média populacional com base nessa pequena amostra de informações. Como você vê, para avaliar esta fórmula você precisa quotthe média do samplequot e da margem de erro do Excel irá calcular automaticamente estas quantidades da maneira que fez para grandes amostras. Novamente, as únicas coisas que você precisa fazer são: adicionar a margem de erro à média da amostra, encontrar o limite superior do intervalo e subtrair a margem de erro da média para encontrar o limite inferior do intervalo. Para demonstrar como o Excel encontra essas quantidades vamos usar o conjunto de dados, que contém as rendas horárias de 10 estudantes de trabalho-estudo aqui, na Universidade de Baltimore. Esses números aparecem nas células A1 a A10 em uma planilha do Excel. Depois de inserir os dados, seguimos o procedimento estatístico descritivo para calcular as quantidades desconhecidas (exatamente como encontramos as quantidades para a grande amostra). Aqui você está com os procedimentos no formulário passo a passo: Passo 1. Digite os dados nas células A1 a A10 na planilha Passo 2. Nos menus selecione Ferramentas Etapa 3. Clique em Análise de Dados e, em seguida, escolha a opção Estatística Descritiva. Clique em OK na caixa de diálogo de estatísticas descritivas, clique em Estatística de resumo, clique no nível de intervalo de confiança e digite 90 ou em outros problemas, independentemente do intervalo de confiança desejado. Na caixa Output Range, digite B1 ou qualquer local que você desejar. Agora clique em OK. A captura de tela será semelhante à seguinte: Agora, como o cálculo do intervalo de confiança para a grande amostra, calcular o intervalo de confiança da população com base nesta pequena amostra informações. O intervalo de confiança é: 6,8 0,414426102 ou 6,39 7,21. Podemos ser pelo menos 90 confidente que o intervalo 6.39 e 7.21 contém a verdadeira média da população. Teste de Hipótese Relativo à Média da População Mais uma vez, devemos distinguir dois casos em relação ao tamanho da Amostra Grande Tamanho da Amostra (por exemplo, mais de 30): Nesta seção você deseja saber como o Excel pode ser usado para realizar um teste de hipótese sobre Uma média populacional. Usaremos os rendimentos horários de diferentes estudantes de trabalho-estudo do que aqueles introduzidos anteriormente na seção de intervalo de confiança. Os dados são introduzidos nas células A1 a A36. O objetivo é testar a seguinte hipótese Nula e Alternativa: A hipótese nula indica que o rendimento horário médio de um estudante de trabalho-estudo é igual a 7 por hora no entanto, a hipótese alternativa indica que a renda horária média não é igual a 7 por hora. Vou repetir as etapas tomadas na estatística descritiva e no final vai mostrar como encontrar o valor das estatísticas de teste neste caso, z, usando uma fórmula de célula. Etapa 1. Digite os dados nas células A1 a A36 (na planilha) Etapa 2. Nos menus selecione Ferramentas Etapa 3. Clique em Análise de Dados e, em seguida, escolha a opção Estatísticas Descritivas, clique em OK. Na caixa de diálogo de estatísticas descritivas, clique em Estatística de Resumo. Selecione a caixa Output Range (intervalo de saída), insira B1 ou o local desejado. Agora clique em OK. (Para calcular o valor da pesquisa de estatísticas de teste para a média da amostra, em seguida, o erro padrão. Em esta saída, esses valores estão nas células C3 e C4.) Etapa 4. Selecione a célula D1 e digite a fórmula de célula (C3-7 ) C4. A captura de tela deve se parecer com o seguinte: O valor na célula D1 é o valor das estatísticas de teste. Uma vez que este valor desce na faixa de aceitação de -1,96 a 1,96 (a partir da tabela de distribuição normal), não conseguimos rejeitar a hipótese nula. Tamanho pequeno da amostra (digamos, menos de 30): Usando as medidas tomadas no caso de grande tamanho da amostra, o Excel pode ser usado para conduzir uma hipótese para o caso de pequena amostra. Vamos usar a renda horária de 10 estudantes de trabalho-estudo em UB para conduzir a seguinte hipótese. A hipótese nula indica que a renda média por hora de um estudante de trabalho-estudo é igual a 7 por hora. A hipótese alternativa indica que a renda média por hora não é igual a 7 por hora. Vou repetir as etapas tomadas em estatística descritiva e no final vai mostrar como encontrar o valor das estatísticas de teste neste caso quottquot usando uma fórmula de célula. Etapa 1. Insira os dados nas células A1 a A10 (na planilha) Etapa 2. Nos menus selecione Ferramentas Etapa 3. Clique em Análise de dados e, em seguida, escolha a opção Estatísticas descritivas. Clique em OK. Na caixa de diálogo de estatísticas descritivas, clique em Estatística de Resumo. Selecione as caixas Output Range, digite B1 ou qualquer local que você escolheu. Novamente, clique em OK. (Para calcular o valor da pesquisa de estatísticas de teste para a média da amostra, em seguida, o erro padrão, nesta saída esses valores estão nas células C3 e C4.) Etapa 4. Selecione a célula D1 e digite a fórmula de célula (C3-7) C4. A captura de tela seria semelhante à seguinte: Uma vez que o valor da estatística de teste t -0,66896 cai na faixa de aceitação -2,262 a 2,262 (de t tabela, onde 0,025 e os graus de liberdade é 9), não podemos rejeitar a hipótese nula. Diferença entre a Média de Duas Populações Nesta seção vamos mostrar como o Excel é usado para conduzir um teste de hipótese sobre a diferença entre dois meios de população assumindo que as populações têm variâncias iguais. Os dados neste caso são tomados de vários escritórios aqui na Universidade de Baltimore. Eu coletei os dados de renda por hora de 36 estudantes de estudo de trabalho selecionados aleatoriamente e 36 assistentes de estudante. A faixa de renda por hora para estudantes de trabalho-estudo foi de 6 a 8, enquanto o intervalo de renda por hora para estudantes assistentes foi 6-9. O objetivo principal neste teste de hipótese é ver se existe uma diferença significativa entre as médias das duas populações. A hipótese NULL ea ALTERNATIVA é que os meios são iguais e os meios não são iguais, respectivamente. Referindo-se à planilha, escolhi A1 e A2 como centros de rótulos. The work-study students hourly income for a sample size 36 are shown in cells A2:A37 . and the student assistants hourly income for a sample size 36 is shown in cells B2:B37 Data for Work Study Student: 6, 6, 6, 6, 6, 6, 6, 6.5, 6.5, 6.5, 6.5, 6.5, 6.5, 7, 7, 7, 7, 7, 7, 7, 7.5, 7.5, 7.5, 7.5, 7.5, 7.5, 8, 8, 8, 8, 8, 8, 8, 8, 8. Data for Student Assistant: 6, 6, 6, 6, 6, 6.5, 6.5, 6.5, 6.5, 6.5, 7, 7, 7, 7, 7, 7.5, 7.5, 7.5, 7.5, 7.5, 7.5, 8, 8, 8, 8, 8, 8, 8, 8.5, 8.5, 8.5, 8.5, 8.5, 9, 9, 9, 9. Use the Descriptive Statistics procedure to calculate the variances of the two samples. The Excel procedure for testing the difference between the two population means will require information on the variances of the two populations. Since the variances of the two populations are unknowns they should be replaced with sample variances. The descriptive for both samples show that the variance of first sample is s 1 2 0.55546218 . while the variance of the second sample s 2 2 0.969748 . To conduct the desired test hypothesis with Excel the following steps can be taken: Step 1. From the menus select Tools then click on the Data Analysis option. Step 2. When the Data Analysis dialog box appears: Choose z-Test: Two Sample for means then click OK Step 3. When the z-Test: Two Sample for means dialog box appears: Enter A1:A36 in the variable 1 range box (work-study students hourly income) Enter B1:B36 in the variable 2 range box (student assistants hourly income) Enter 0 in the Hypothesis Mean Difference box (if you desire to test a mean difference other than 0, enter that value) Enter the variance of the first sample in the Variable 1 Variance box Enter the variance of the second sample in the Variable 2 Variance box and select Labels Enter 0.05 or, whatever level of significance you desire, in the Alpha box Select a suitable Output Range for the results, I chose C19 . then click OK. The value of test statistic z-1.9845824 appears in our case in cell D24. The rejection rule for this test is z 1.96 from the normal distribution table. In the Excel output these values for a two-tail test are z 1.959961082. Since the value of the test statistic z-1.9845824 is less than -1.959961082 we reject the null hypothesis. We can also draw this conclusion by comparing the p-value for a two tail - test and the alpha value. Since p-value 0.047190813 is less than a0.05 we reject the null hypothesis. Overall we can say, based on the sample results, the two populations means are different. Small Samples: n 1 OR n 2 are less than 30 In this section we will show how Excel is used to conduct a hypothesis test about the difference between two population means. - Given that the populations have equal variances when two small independent samples are taken from both populations. Similar to the above case, the data in this case are taken from various offices here at the University of Baltimore. I collected hourly income data of 11 randomly selected work-study students and 11 randomly selected student assistants. The hourly income range for both groups was similar range, 6 - 8 and 6-9. The main objective in this hypothesis testing is similar too, to see whether there is a significant difference between the means of the two populations. The NULL and the ALTERNATIVE hypothesis are that the means are equal and they are not equal, respectively. Referring to the spreadsheet, we chose A1 and A2 as label centers. The work-study students hourly income for a sample size 11 are shown in cells A2:A12 . and the student assistants hourly income for a sample size 11 is shown in cells B2:B12 . Unlike previous case, you do not have to calculate the variances of the two samples, Excel will automatically calculate these quantities and use them in the calculation of the value of the test statistic. Similar to the previous case, but a bit different in step 2, to conduct the desired test hypothesis with Excel the following steps can be taken: Step 1. From the menus select Tools then click on the Data Analysis option. Step 2. When the Data Analysis dialog box appears: Choose t-Test: Two Sample Assuming Equal Variances then click OK Step 3 When the t-Test: Two Sample Assuming Equal Variances dialog box appears : Enter A1:A12 in the variable 1 range box (work-study student hourly income) Enter B1:B12 in the variable 2 range box (student assistant hourly income) Enter 0 in the Hypothesis Mean Difference box(if you desire to test a mean difference other than zero, enter that value) then select Labels Enter 0.05 or, whatever level of significance you desire, in the Alpha box Select a suitable Output Range for the results, I chose C1, then click OK. The value of the test statistic t-1.362229828 appears, in our case, in cell D10. The rejection rule for this test is t 2.086 from the t distribution table where the t value is based on a t distribution with n 1 - n 2 -2 degrees of freedom and where the area of the upper one tail is 0.025 ( that is equal to alpha2). In the Excel output the values for a two-tail test are t 2.085962478. Since the value of the test statistic t-1.362229828, is in an acceptance range of t 2.085962478, we fail to reject the null hypothesis. We can also draw this conclusion by comparing the p-value for a two-tail test and the alpha value. Since the p-value 0.188271278 is greater than a0.05 again . we fail to reject the null hypothesis. Overall we can say, based on sample results, the two populations means are equal. Enter data in an Excel work sheet starting with cell A2 and ending with cell C8. The following steps should be taken to find the proper output for interpretation. Step 1. From the menus select Tools and click on Data Analysis option. Step 2. When data analysis dialog appears, choose Anova single-factor option enter A2:C8 in the input range box. Select labels in first row. Step3. Select any cell as output(in here we selected A11). Click OK. The general form of Anova table looks like following: Source of Variation Suppose the test is done at level of significance a 0.05, we reject the null hypothesis. This means there is a significant difference between means of hourly incomes of student assistants in these departments. The Two-way ANOVA Without Replication In this section, the study involves six students who were offered different hourly wages in three different department services here at the University of Baltimore. The objective is to see whether the hourly incomes are the same. Therefore, we can consider the following: Treatment: Hourly payments in the three departments Blocks: Each student is a block since each student has worked in the three different departments The general form of Anova table would look like: Source of Variation Degrees of freedom To find the Excel output for the above data the following steps can be taken: Step 1. From the menus select Tools and click on Data Analysis option. Step2. When data analysis box appears: select Anova two-factor without replication then Enter A2: D8 in the input range. Select labels in first row. Step3. Select an output range (in here we selected A11) then OK. Source of Variation NOTE: FMSTMSE 0.9805560.497222 1.972067 F 3.33 from table (5 numerator DF and 10 denominator DF) Since 1.972067 Goodness-of-Fit Test for Discrete Random Variables The CHI-SQUARE distribution can be used in a hypothesis test involving a population variance. However, in this section we would like to test and see how close a sample results are to the expected results. Example: The Multinomial Random Variable In this example the objective is to see whether or not based on a randomly selected sample information the standards set for a population is met. There are so many practical examples that can be used in this situation. For example it is assumed the guidelines for hiring people with different ethnic background for the US government is set at 70(WHITE), 20(African American) and 10(others), respectively. A randomly selected sample of 1000 US employees shows the following results that is summarized in a table. EXPECTED NUMBER OF EMPLOYEES OBSERVED FROM SAMPLE As you see the observed sample numbers for groups two and three are lower than their expected values unlike group one which has a higher expected value. Is this a clear sign of discrimination with respect to ethnic background Well depends on how much lower the expected values are. The lower amount might not statistically be significant. To see whether these differences are significant we can use Excel and find the value of the CHI-SQUARE. If this value falls within the acceptance region we can assume that the guidelines are met otherwise they are not. Now lets enter these numbers into Excel spread - sheet. We used cells B7-B9 for the expected proportions, C7-C9 for the observed values and D7-D9 for the expected frequency. To calculate the expected frequency for a category, you can multiply the proportion of that category by the sample size (in here 1000). The formula for the first cell of the expected value column, D7 is 1000B7. To find other entries in the expected value column, use the copy and the paste menu as shown in the following picture. These are important values for the chi-square test. The observed range in this case is C7: C9 while the expected range is D7: D9. The null and the alternative hypothesis for this test are as follows: H A . The population proportions are not P W 0.70, P A 0.20 and P O 0.10 Now lets use Excel to calculate the p-value in a CHI-SQUARE test. Step 1. Select a cell in the work sheet, the location which you like the p value of the CHI-SQUARE to appear. We chose cell D12. Step 2. From the menus, select insert then click on the Function option, Paste Function dialog box appears. Step 3. Refer to function category box and choose statistical . from function name box select CHITEST and click on OK . Step 4. When the CHITEST dialog appears: Enter C7: C9 in the actual-range box then enter D7: D9 in the expected-range box, and finally click on OK . The p-value will appear in the selected cell, D12. As you see the p value is 0.002392 which is less than the value of the level of significance (in this case the level of significance, a 0.10). Hence the null hypothesis should be rejected. This means based on the sample information the guidelines are not met. Notice if you type CHITEST(C7:C9,D7:D9) in the formula bar the p-value will show up in the designated cell. NOTE: Excel can actually find the value of the CHI-SQUARE. To find this value first select an empty cell on the spread sheet then in the formula bar type CHIINV(D12,2). D12 designates the p-Value found previously and 2 is the degrees of freedom (number of rows minus one). The CHI-SQUARE value in this case is 12.07121. If we refer to the CHI-SQUARE table we will see that the cut off is 4.60517 since 12.071214.60517 we reject the null. The following screen shot shows you how to the CHI-SQUARE value. Test of Independence: Contingency Tables The CHI-SQUARE distribution is also used to test and see whether two variables are independent or not. For example based on sample data you might want to see whether smoking and gender are independent events for a certain population. The variables of interest in this case are smoking and the gender of an individual. Another example in this situation could involve the age range of an individual and his or her smoking habit. Similar to case one data may appear in a table but unlike the case one this table may contains several columns in addition to rows. The initial table contains the observed values. To find expected values for this table we set up another table similar to this one. To find the value of each cell in the new table we should multiply the sum of the cell column by the sum of the cell row and divide the results by the grand total. The grand total is the total number of observations in a study. Now based on the following table test whether or not the smoking habit and gender of the population that the following sample taken from are independent. On the other hand is that true that males in this population smoke more than females You could use formula bar to calculate the expected values for the expected range. For example to find the expected value for the cell C5 which is replaced in c11 you could click on the formula bar and enter C6D5D6 then enter in cell C11. Step 1. Observed Range b4:c5 Smoking and gender So the observed range is b4:c5 and the expected range is b10:c11. Step 3. Click on fx (paste function) Step 4. When Paste Function dialog box appears, click on Statistical in function category and CHITEST in the function name then click OK. When the CHITEST box appears, enter b4:c5 for the actual range, then b10:c11 for the expected range. Step 5. Click on OK (the p-value appears). 0.477395 Conclusion: Since p-value is greater than the level of significance (0.05), fails to reject the null. This means smoking and gender are independent events. Based on sample information one can not assure females smoke more than males or the other way around. Step 6. To find the chi-square value, use CHINV function, when Chinv box appears enter 0.477395 for probability part, then 1 for the degrees of freedom. Degrees of freedom(number of columns-1)X(number of rows-1) Test Hypothesis Concerning the Variance of Two Populations In this section we would like to examine whether or not the variances of two populations are equal. Whenever independent simple random samples of equal or different sizes such as n 1 and n 2 are taken from two normal distributions with equal variances, the sampling distribution of s 1 2 s 2 2 has F distribution with n 1 - 1 degrees of freedom for the numerator and n 2 - 1 degrees of freedom for the denominator. In the ratio s 1 2 s 2 2 the numerator s 1 2 and the denominator s 2 2 are variances of the first and the second sample, respectively. The following figure shows the graph of an F distribution with 10 degrees of freedom for both the numerator and the denominator. Unlike the normal distribution as you see the F distribution is not symmetric. The shape of an F distribution is positively skewed and depends on the degrees of freedom for the numerator and the denominator. The value of F is always positive. Now let see whether or not the variances of hourly income of student-assistant and work-study students based on samples taken from populations previously are equal. Assume that the hypothesis test in this case is conducted at a 0.10. The null and the alternative are: Rejection Rule: Reject the null hypothesis if Flt F 0.095 or Fgt F 0.05 where F, the value of the test statistic is equal to s 1 2 s 2 2. with 10 degrees of freedom for both the numerator and the denominator. We can find the value of F .05 from the F distribution table. If s 1 2 s 2 2. we do not need to know the value of F 0.095 otherwise, F 0.95 1 F 0.05 for equal sample sizes. A survey of eleven student-assistant and eleven work-study students shows the following descriptive statistics. Our objective is to find the value of s 1 2 s 2 2. where s 1 2 is the value of the variance of student assistant sample and s 2 2 is the value of the variance of the work study students sample. As you see these values are in cells F8 and D8 of the descriptive statistic output. To calculate the value of s 1 2 s 2 2. select a cell such as A16 and enter cell formula F8D8 and enter. This is the value of F in our problem. Since this value, F1.984615385, falls in acceptance area we fail to reject the null hypothesis. Hence, the sample results do support the conclusion that student assistants hourly income variance is equal to the work study students hourly income variance. The following screen shoot shows how to find the F value. We can follow the same format for one tail test(s). Linear Correlation and Regression Analysis In this section the objective is to see whether there is a correlation between two variables and to find a model that predicts one variable in terms of the other variable. There are so many examples that we could mention but we will mention the popular ones in the world of business. Usually independent variable is presented by the letter x and the dependent variable is presented by the letter y. A business man would like to see whether there is a relationship between the number of cases of sold and the temperature in a hot summer day based on information taken from the past. He also would like to estimate the number cases of soda which will be sold in a particular hot summer day in a ball game. He clearly recorded temperatures and number of cases of soda sold on those particular days. The following table shows the recorded data from June 1 through June 13. The weatherman predicts a 94F degree temperature for June 14. The businessman would like to meet all demands for the cases of sodas ordered by customers on June 14. Now lets use Excel to find the linear correlation coefficient and the regression line equation. The linear correlation coefficient is a quantity between -1 and 1. This quantity is denoted by R . The closer R to 1 the stronger positive (direct) correlation and similarly the closer R to -1 the stronger negative (inverse) correlation exists between the two variables. The general form of the regression line is y mx b. In this formula, m is the slope of the line and b is the y-intercept. You can find these quantities from the Excel output. In this situation the variable y (the dependent variable) is the number of cases of soda and the x (independent variable) is the temperature. To find the Excel output the following steps can be taken: Step 1. From the menus choose Tools and click on Data Analysis. Step 2. When Data Analysis dialog box appears, click on correlation. Step 3. When correlation dialog box appears, enter B1:C14 in the input range box. Click on Labels in first row and enter a16 in the output range box. Click on OK. As you see the correlation between the number of cases of soda demanded and the temperature is a very strong positive correlation. This means as the temperature increases the demand for cases of soda is also increasing. The linear correlation coefficient is 0.966598577 which is very close to 1. Now lets follow same steps but a bit different to find the regression equation. Step 1. From the menus choose Tools and click on Data Analysis Step 2 . When Data Analysis dialog box appears, click on regression . Step 3. When Regression dialog box appears, enter b1:b14 in the y-range box and c1:c14 in the x-range box. Click on labels . Step 4. Enter a19 in the output range box . Note: The regression equation in general should look like Ym X b. In this equation m is the slope of the regression line and b is its y-intercept. Adjusted R Square The relationship between the number of cans of soda and the temperature is: Y 0.879202711 X 9.17800767 The number of cans of soda 0.879202711(Temperature) 9.17800767. Referring to this expression we can approximately predict the number of cases of soda needed on June 14. The weather forecast for this is 94 degrees, hence the number of cans of soda needed is equal to The number of cases of soda0.879202711(94) 9.17800767 91.82 or about 92 cases. Moving Average and Exponential Smoothing Moving Average Models: Use the Add Trendline option to analyze a moving average forecasting model in Excel. You must first create a graph of the time series you want to analyze. Select the range that contains your data and make a scatter plot of the data. Once the chart is created, follow these steps: Click on the chart to select it, and click on any point on the line to select the data series. When you click on the chart to select it, a new option, Chart, s added to the menu bar. From the Chart menu, select Add Trendline. The following is the moving average of order 4 for weekly sales: Exponential Smoothing Models: The simplest way to analyze a timer series using an Exponential Smoothing model in Excel is to use the data analysis tool. This tool works almost exactly like the one for Moving Average, except that you will need to input the value of a instead of the number of periods, k. Once you have entered the data range and the damping factor, 1- a. and indicated what output you want and a location, the analysis is the same as the one for the Moving Average model. Applications and Numerical Examples Descriptive Statistics: Suppose you have the following, n 10, data: 1.2, 1.5, 2.6, 3.8, 2.4, 1.9, 3.5, 2.5, 2.4, 3.0 Type your n data points into the cells A1 through An. Click on the Tools menu. (At the bottom of the Tools menu will be a submenu Data Analysis. , if the Analysis Tool Pack has been properly installed.) Clicking on Data Analysis. will lead to a menu from which Descriptive Statistics is to be selected. Select Descriptive Statistics by pointing at it and clicking twice, or by highlighting it and clicking on the Okay button. Within the Descriptive Statistics submenu, a. for the input range enter A1:Dn, assuming you typed the data into cells A1 to An. b. click on the output range button and enter the output range C1:C16. c. click on the Summary Statistics box d. finally, click on Okay. The Central Tendency: The data can be sorted in ascending order: 1.2, 1.5, 1.9, 2.4, 2.4, 2.5, 2.6, 3.0, 3.5, 3.8 The mean, median and mode are computed as follows: (1.2 1.5 2.6 3.8 2.4 1.9 3.5 2.5 2.4 3.0) 10 2.48 The mode is 2.4, since it is the only value that occurs twice. The midrange is (1.2 3.8) 2 2.5. Note that the mean, median and mode of this set of data are very close to each other. This suggests that the data is very symmetrically distributed. Variance: The variance of a set of data is the average of the cumulative measure of the squares of the difference of all the data values from the mean. The sample variance-based estimation for the population variance are computed differently. The sample variance is simply the arithmetic mean of the squares of the difference between each data value in the sample and the mean of the sample. On the other hand, the formula for an estimate for the variance in the population is similar to the formula for the sample variance, except that the denominator in the fraction is (n-1) instead of n. However, you should not worry about this difference if the sample size is large, say over 30. Compute an estimate for the variance of the population . given the following sorted data: 1.2, 1.5, 1.9, 2.4, 2.4, 2.5, 2.6, 3.0, 3.5, 3.8 mean 2.48 as computed earlier. An estimate for the population variance is: s 2 1 (10-1) (1.2 - 2.48) 2 (1.5 - 2.48) 2 (1.9 - 2.48) 2 (2.4 -2.48) 2 (2.4 - 2.48) 2 (2.5 - 2.48) 2 (2.6 - 2.48) 2 (3.0 - 2.48) 2 (3.5 -2.48) 2 (3.8 - 2.48) 2 (1 9) (1.6384 0.9604 0.3364 0.0064 0.0064 0.0004 0.0144 0.2704 1.0404 1.7424) 0.6684 Therefore, the standard deviation is s ( 0.6684 ) 12 0.8176 Probability and Expected Values: Newsweek reported that average take for bank robberies was 3,244 but 85 percent of the robbers were caught. Assuming 60 percent of those caught lose their entire take and 40 percent lose half, graph the probability mass function using EXCEL. Calculate the expected take from a bank robbery. Does it pay to be a bank robber To construct the probability function for bank robberies, first define the random variable x, bank robbery take. If the robber is not caught, x 3,244. If the robber is caught and manages to keep half, x 1,622. If the robber is caught and loses it all, then x 0. The associated probabilities for these x values are 0.15 (1 - 0.85), 0.34 (0.85)(0.4), and 0.51 (0.85)(0.6). After entering the x values in cells A1, A2 and A3 and after entering the associated probabilities in B1, B2, and B3, the following steps lead to the probability mass function: Click on ChartWizard. The ChartWizard Step 1 of 4 screen will appear. Highlight Column at ChartWizard Step 1 of 4 and click Next. At ChartWizard Step 2 of 4 Chart Source Data, enter B1:B3 for Data range, and click column button for Series in. A graph will appear. Click on series toward the top of the screen to get a new page. At the bottom of the Series page, is a rectangle for Category (X) axis labels: Click on this rectangle and then highlight A1:A3. At Step 3 of 4 move on by clicking on Next, and at Step 4 of 4, click on Finish. The expected value of a robbery is 1,038.08. E(X) (0)(0.51)(1622)(0.34) (3244)(0.15) 0 551.48 486.60 1038.08 The expected return on a bank robbery is positive. On average, bank robbers get 1,038.08 per heist. If criminals make their decisions strictly on this expected value, then it pays to rob banks. A decision rule based only on an expected value, however, ignores the risks or variability in the returns. In addition, our expected value calculations do not include the cost of jail time, which could be viewed by criminals as substantial. Discrete Continuous Random Variables: Binomial Distribution Application: A multiple choice test has four unrelated questions. Each question has five possible choices but only one is correct. Thus, a person who guesses randomly has a probability of 0.2 of guessing correctly. Draw a tree diagram showing the different ways in which a test taker could get 0, 1, 2, 3 and 4 correct answers. Sketch the probability mass function for this test. What is the probability a person who guesses will get two or more correct Solution: Letting Y stand for a correct answer and N a wrong answer, where the probability of Y is 0.2 and the probability of N is 0.8 for each of the four questions, the probability tree diagram is shown in the textbook on page 182. This probability tree diagram shows the branches that must be followed to show the calculations captured in the binomial mass function for n 4 and 0.2. For example, the tree diagram shows the six different branch systems that yield two correct and two wrong answers (which corresponds to 4(22) 6. The binomial mass function shows the probability of two correct answers as P(x 2 n 4, p 0.2) 6(.2)2(.8)2 6(0.0256) 0.1536 P(2) Which is obtained from excel by using the BINOMDIST Command, where the first entry is x, the second is n, and the third is mass (0) or cumulative (1) that is, entering BINOMDIST(2,4,0.2,0) IN ANY EXCEL CELL YIELDS 0.1536 AND BINOMDIST(3,4,0.2,0) YIELDS P(x3n4, p 0.2) 0.0256 BINOMDIST(4,4,0.2,0) YIELDS P(x4n4, p 0.2) 0.0016 1-BINOMDIST(1,4,0.2,1) YIELDS P(x 179 2 n 4, p 0.2) 0.1808 Normal Example: If the time required to complete an examination by those with a certain learning disability is believed to be distributed normally, with mean of 65 minutes and a standard deviation of 15 minutes, then when can the exam be terminated so that 99 percent of those with the disability can finish Solution: Because t he average and standard deviation are known, what needs to be established is the amount of time, above the mean time, such that 99 percent of the distribution is lower. This is a distance that is measured in standard deviations as given by the Z value corresponding to the 0.99 probability found in the body of Appendix B, Table 5,as shown in the textbook OR the commands entered into any cell of Excel to find this Z value is NORMINV(0.99,0,1) for 2.326342. The closest cumulative probability that can be found is 0.9901, in the row labeled 2.3 and column headed by .03, Z 2.33, which is only an approximation for the more exact 2.326342 found in Excel. Using this more exact value the calculation with mean m and standard deviation s in the following formula would be Z ( X - m ) s That is, Z ( x - 65)15 Thus, x 65 15(2.32634) 99.9 minutes. Alternatively, instead of standardizing with the Z distribution using Excel we can simply work directly with the normal distribution with a mean of 65 and standard deviation of 15 and enter NORMINV(0.99,65,15). In general to obtain the x value for which alpha percent of a normal random variables values are lower, the following NORMINV command may be used, where the first entry is a. the second is m. and the third is s. Another Example: In the early 1980s, the Toro Company of Minneapolis, Minnesota, advertised that it would refund the purchase price of a snow blower if the following winters snowfall was less than 21 percent of the local average. If the average snowfall is 45.25 inches, with a standard deviation of 12.2 inches, what is the likelihood that Toro will have to make refunds Solution: Within limits, snowfall is a continuous random variable that can be expected to vary symmetrically around its mean, with values closer to the mean occurring most often. Thus, it seems reasonable to assume that snowfall (x) is approximately normally distributed with a mean of 45.25 inches and standard deviation of 12.2 inches. Nine and one half inches is 21 percent of the mean snowfall of 45.25 inches and, with a standard deviation of 12.2 inches, the number of standard deviations between 45.25 inches and 9.5 inches is Z: Z ( x - m ) s (9.50 - 45.25)12.2 -2.93 Using Appendix B, Table 5, the textbook demonstrates the determination of P(x 163 9.50) P(z 163 -2.93) 0.17, the probability of snowfall less than 9.5 inches. Using Excel, this normal probability is obtained with the NORMDIST command, where the first entry is x, the second is mean m. the third is standard deviation s, and the fourth is CUMULATIVE (1). Entering NORMDIST(9.5,45.25,12.2,1), Gives P( x 163 9.50) 0.001693. Sampling Distribution and the Central Limit Theorem : A bakery sells an average of 24 loaves of bread per day. Sales (x) are normally distributed with a standard deviation of 4. If a random sample of size n 1 (day) is selected, what is the probability this x value will exceed 28 If a random sample of size n 4 (days) is selected, what is theprobability that xbar 179 28 Why does the answer in part 1 differ from that in part 2 1. The sampling distribution of the sample mean xbar is normal with a mean of 24 and a standard error of the mean of 4. Thus, using Excel, 0.15866 1-NORMDIST(28,24,4,1). 2. The sampling distribution of the sample mean xbar is normal with a mean of 24 and a standard error of the mean of 2 using Excel, 0.02275 1-NORMDIST(28,24,2,1). Regression Analysis: The highway deaths per 100 million vehicle miles and highway speed limits for 10 countries, are given below: (Death, Speed) (3.0, 55), (3.3, 55), (3.4, 55), (3.5, 70), (4.1, 55), (4.3, 60), (4.7, 55), (4.9, 60), (5.1, 60), and (6.1, 75). From this we can see that five countries with the same speed limit have very different positions on the safety list. For example, Britain. with a speed limit of 70 is demonstrably safer than Japan, at 55. Can we argue that, speed has little to do with safety. Use regression analysis to answer this question. Solution: Enter the ten paired y and x data into cells A2 to A11 and B2 to B11, with the death rate label in A1 and speed limits label in B1, the following steps produce the regression output. Choose Regression from Data Analysis in the Tools menu. The Regression dialog box will will appear. Note: Use the mouse to move between the boxes and buttons. Click on the desired box or button. The large rectangular boxes require a range from the worksheet. A range may be typed in or selected by highlighting the cells with the mouse after clicking on the box. If the dialog box blocks the data, it can be moved on the screen by clicking on the title bar and dragging. For the Input Y Range, enter A1 to A11, and for the Input X Range enter B1 to B11. Because the Y and X ranges include the Death and Speed labels in A1 and B1, select the Labels box with a click. Click the Output Range button and type reference cell, which in this demonstration is A13. To get the predicted values of Y (Death rates) and residuals select the Residuals box with a click. Your screen display should show a Table, clicking OK will give the SUMMARY OUTPUT, ANOVA AND RESIDUAL OUTPUT The first section of the EXCEL printout gives SUMMARY OUTPUT. The Multiple R is the square root of the R Square the computation and interpretation of which we have already discussed. The Standard Error of estimate (which will be discussed in the next chapter) is s 0.86423, which is the square root of Residual SS 5.97511 divided by its degrees of freedom, df 8, as given in the ANOVA section. We will also discuss the adjusted R-square of 0.21325 in the following chapters. Under the ANOVA section are the estimated regression coefficients and related statistics that will be discussed in detail in the next chapter. For now it is sufficient to recognize that the calculated coefficient values for the slope and y intercept are provided (b 0.07556 and a -0.29333). Next to these coefficient estimates is information on the variability in the distribution of the least-squares estimators from which these specific estimates were drawn: the column titled Std. Error contains the standard deviations (standard errors) of the intercept and slope distributions the t-ratio and p columns give the calculated values of the t statistics and associated p-values. As shown in Chapter 13, the t statistic of 1.85458 and p-value of 0.10077, for example, indicates that the sample slope (0.07556) is sufficiently different from zero, at even the 0.10 two-tail Type I error level, to conclude that there is a significant relationship between deaths and speed limits in the population. This conclusion is contrary to assertion that speed has little to do with safety. SUMMARY OUTPUT: Multiple R 0.54833, R Square 0.30067, Adjusted R Square 0.21325, Standard Error 0.86423, Observations 10 ANOVA df SS MS F P-value Regression 1 2.56889 2.56889 3.43945 0.10077 Residual 8 5.97511 0.74689 Total 9 8.54400 Coeffs. Estimate Std. Error T Stat P-value Lower 95 Upper 95 Intercept -0.29333 2.45963 -0.11926 0.90801 -5.96526 5.37860 Speed 0.07556 0.04074 1.85458 0.10077 -0.01839 0.16950 Predicted Residuals 3.86222 -0.86222 3.86222 -0.56222 3.86222 -0.46222 4.99556 -1.49556 3.86222 0.23778 4.24000 0.06000 3.86222 0.83778 4.24000 0.66000 4.24000 0.86000 5.37333 0.72667 Microsoft Excel Add-Ins Forecasting with regression requires the Excel add-in called Analysis ToolPak , and linear programming requires the Excel add-in called Solver . How you check to see if these are activated on your computer, and how to activate them if they are not active, varies with Excel version. Here are instructions for the most common versions. If Excel will not let you activate Data Analysis and Solver, you must use a different computer. Excel 20022003: Start Excel, then click Tools and look for Data Analysis and for Solver. If both are there, press Esc (escape) and continue with the respective assignment. Otherwise click Tools, Add-Ins, and check the boxes for Analysis ToolPak and for Solver, then click OK. Click Tools again, and both tools should be there. Excel 2007: Start Excel 2007 and click the Data tab at the top. Look to see if Data Analysis and Solver show in the Analysis section at the far right. If both are there, continue with the respective assignment. Otherwise, do the following steps exactly as indicated: - click the 8220Office Button8221 at top left - click the Excel Options button near the bottom of the resulting window - click the Add-ins button on the left of the next screen - near the bottom at Manage Excel Add-ins, click Go - check the boxes for Analysis ToolPak and Solver Add-in if they are not already checked, then click OK - click the Data tab as above and verify that the add-ins show. Excel 2010: Start Excel 2010 and click the Data tab at the top. Look to see if Data Analysis and Solver show in the Analysis section at the far right. If both are there, continue with the respective assignment. Otherwise, do the following steps exactly as indicated: - click the File tab at top left - click the Options button near the bottom of the left side - click the Add-ins button near the bottom left of the next screen - near the bottom at Manage Excel Add-ins, click Go - check the boxes for Analysis ToolPak and Solver Add-in if they are not already checked, then click OK - click the Data tab as above and verify that the add-ins show. Solving Linear Programs by Excel Some of these examples can be modified for other types problems Computer-assisted Learning: E-Labs and Computational Tools My teaching style deprecates the plug the numbers into the software and let the magic box work it out approach. Personal computers, spreadsheets, e. g. Excel. professional statistical packages (e. g. such as SPSS), and other information technologies are now ubiquitous in statistical data analysis. Without using these tools, one cannot perform any realistic statistical data analysis on large data sets. The appearance of other computer software, JavaScript Applets. Statistical Demonstrations Applets. and Online Computation are the most important events in the process of teaching and learning concepts in model-based statistical decision making courses. These tools allow you to construct numerical examples to understand the concepts, and to find their significance for yourself. Use any or online interactive tools available on the WWW to perform statistical experiments (with the same purpose, as you used to do experiments in physics labs to learn physics) to understand statistical concepts such as Central Limit Theorem are entertaining and educating. Computer-assisted learning is similar to the experiential model of learning. The adherents of experiential learning are fairly adamant about how we learn. Learning seldom takes place by rote. Learning occurs because we immerse ourselves in a situation in which we are forced to perform and think. You get feedback from the computer output and then adjust your thinking-process if needed. A SPSS-Example . SPSS-Examples . SPSS-More Examples . (Statistical Package for the Social Sciences) is a data management and analysis product. It can perform a variety of data analysis and presentation functions, including statistical analyses and graphical presentation of data. SAS (Statistical Analysis System) is a system of software packages some of its basic functions and uses are: database management inputting, cleaning and manipulating data, statistical analysis, calculating simple statistics such as means, variances, correlations running standard routines such as regressions. Available at: SPSSSAS Packages on Citrix (Installing and Accessing ) Use your email ID and Password: Technical Difficulties OTS Call Center (401) 837-6262 Excel Examples. Excel More Examples It is Excellent for Descriptive Statistics, and getting acceptance is improving, as computational tool for Inferential Statistics. The Value of Performing Experiment: If the learning environment is focused on background information, knowledge of terms and new concepts, the learner is likely to learn that basic information successfully. However, this basic knowledge may not be sufficient to enable the learner to carry out successfully the on-the-job tasks that require more than basic knowledge. Thus, the probability of making real errors in the business environment is high. On the other hand, if the learning environment allows the learner to experience and learn from failures within a variety of situations similar to what they would experience in the real world of their job, the probability of having similar failures in their business environment is low. This is the realm of simulations-a safe place to fail. The appearance of statistical software is one of the most important events in the process of decision making under uncertainty. Statistical software systems are used to construct examples, to understand the existing concepts, and to find new statistical properties. On the other hand, new developments in the process of decision making under uncertainty often motivate developments of new approaches and revision of the existing software systems. Statistical software systems rely on a cooperation of statisticians, and software developers. Beside the professional statistical software Online statistical computation . and the use of a scientific calculator is required for the course. A Scientific Calculator is the one, which has capability to give you, say, the result of square root of 5. Any calculator that goes beyond the 4 operations is fine for this course. These calculators allow you to perform simple calculations you need in this course, for example, enabling you to take square root, to raise e to the power of say, 0.36. and so on. These types of calculators are called general Scientific Calculators. There are also more specific and advanced calculators for mathematical computations in other areas such as Finance, Accounting, and even Statistics. The last one, for example, computes mean, variance, skewness, and kurtosis of a sample by simply entering all data one-by-one and then pressing any of the mean, variance, skewness, and kurtosis keys. Without a computer one cannot perform any realistic statistical data analysis. Students who are signing up for the course are expected to know the basics of Excel. As a starting point, you need visiting the Excel Web site created for this course. If you are challenged by or unfamiliar with Excel, you may seek tutorial help from the Academic Resource Center at 410-837-5385, E-mail. What and How to Hand-in My Computer Assignment For the computer assignment I do recommend in checking your hand computation homework, and checking some of the numerical examples from your textbook. As part of your homework assignment you don not have to hand in the printout of the computer assisted learning, however, you must include within your handing homework a paragraph entitled Computer Implementation describing your (positive or negative) experience. Interesting and Useful Sites The Copyright Statement: The fair use, according to the 1996 Fair Use Guidelines for Educational Multimedia. of materials presented on this Web site is permitted for non-commercial and classroom purposes only. This site may be mirrored intact (including these notices), on any server with public access. All files are available at home. ubalt. eduntsbarshBusiness-stat for mirroring. Kindly e-mail me your comments, suggestions, and concerns. Obrigado. EOF: CopyRights 1994-2015.Moving average and exponential smoothing models As a first step in moving beyond mean models, random walk models, and linear trend models, nonseasonal patterns and trends can be extrapolated using a moving-average or smoothing model. A suposição básica por trás dos modelos de média e suavização é que a série temporal é estacionária localmente com uma média lentamente variável. Assim, tomamos uma média móvel (local) para estimar o valor atual da média e, em seguida, usá-lo como a previsão para o futuro próximo. Isto pode ser considerado como um compromisso entre o modelo médio eo modelo randômico-sem-deriva. A mesma estratégia pode ser usada para estimar e extrapolar uma tendência local. Uma média móvel é chamada frequentemente uma versão quotsmoothedquot da série original porque a média de curto prazo tem o efeito de alisar para fora os solavancos na série original. Ajustando o grau de suavização (a largura da média móvel), podemos esperar encontrar algum tipo de equilíbrio ótimo entre o desempenho dos modelos de caminhada média e aleatória. O tipo mais simples de modelo de média é o. Média Móvel Simples (igualmente ponderada): A previsão para o valor de Y no tempo t1 que é feita no tempo t é igual à média simples das observações m mais recentes: (Aqui e em outro lugar usarei o símbolo 8220Y-hat8221 para ficar Para uma previsão da série de tempo Y feita o mais cedo possível antes de um determinado modelo). Esta média é centrada no período t (m1) 2, o que implica que a estimativa da média local tende a ficar aquém do verdadeiro Valor da média local em cerca de (m1) 2 períodos. Dessa forma, dizemos que a idade média dos dados na média móvel simples é (m1) 2 em relação ao período para o qual a previsão é calculada: é a quantidade de tempo que as previsões tendem a ficar atrás dos pontos de viragem nos dados . Por exemplo, se você estiver calculando a média dos últimos 5 valores, as previsões serão cerca de 3 períodos atrasados em responder a pontos de viragem. Observe que se m1, o modelo de média móvel simples (SMA) é equivalente ao modelo de caminhada aleatória (sem crescimento). Se m é muito grande (comparável ao comprimento do período de estimação), o modelo SMA é equivalente ao modelo médio. Como com qualquer parâmetro de um modelo de previsão, é costume ajustar o valor de k para obter o melhor quotfitquot aos dados, isto é, os erros de previsão mais baixos em média. Aqui está um exemplo de uma série que parece apresentar flutuações aleatórias em torno de uma média de variação lenta. Primeiro, vamos tentar encaixá-lo com um modelo de caminhada aleatória, o que equivale a uma média móvel simples de 1 termo: O modelo de caminhada aleatória responde muito rapidamente às mudanças na série, mas ao fazê-lo escolhe grande parte do quotnoisequot na Dados (as flutuações aleatórias), bem como o quotsignalquot (a média local). If we instead try a simple moving average of 5 terms, we get a smoother-looking set of forecasts: The 5-term simple moving average yields significantly smaller errors than the random walk model in this case. A idade média dos dados nessa previsão é 3 ((51) 2), de modo que ela tende a ficar atrás de pontos de viragem em cerca de três períodos. (Por exemplo, uma desaceleração parece ter ocorrido no período 21, mas as previsões não virar até vários períodos mais tarde.) Observe que as previsões de longo prazo do modelo SMA são uma linha reta horizontal, assim como na caminhada aleatória modelo. Assim, o modelo SMA assume que não há tendência nos dados. No entanto, enquanto as previsões a partir do modelo de caminhada aleatória são simplesmente iguais ao último valor observado, as previsões do modelo SMA são iguais a uma média ponderada de valores recentes. Os limites de confiança calculados pela Statgraphics para as previsões de longo prazo da média móvel simples não se alargam à medida que o horizonte de previsão aumenta. Isto obviamente não é correto Infelizmente, não há uma teoria estatística subjacente que nos diga como os intervalos de confiança devem se ampliar para este modelo. No entanto, não é muito difícil calcular estimativas empíricas dos limites de confiança para as previsões de longo prazo. Por exemplo, você poderia configurar uma planilha na qual o modelo SMA seria usado para prever 2 passos à frente, 3 passos à frente, etc. dentro da amostra de dados históricos. Você poderia então calcular os desvios padrão da amostra dos erros em cada horizonte de previsão e então construir intervalos de confiança para previsões de longo prazo adicionando e subtraindo múltiplos do desvio padrão apropriado. Se tentarmos uma média móvel simples de 9 termos, obteremos previsões ainda mais suaves e mais de um efeito retardado: A idade média é agora de 5 períodos ((91) 2). Se tomarmos uma média móvel de 19 períodos, a idade média aumenta para 10: Observe que, na verdade, as previsões estão agora atrasadas por volta dos pontos de inflexão por cerca de 10 períodos. A quantidade de suavização é melhor para esta série Aqui está uma tabela que compara suas estatísticas de erro, incluindo também uma média de 3-termo: Modelo C, a média móvel de 5-termo, rende o menor valor de RMSE por uma pequena margem sobre o 3 E médias de 9-termo, e suas outras estatísticas são quase idênticas. Assim, entre modelos com estatísticas de erro muito semelhantes, podemos escolher se preferiríamos um pouco mais de resposta ou um pouco mais de suavidade nas previsões. O modelo de média móvel simples descrito acima tem a propriedade indesejável de tratar as últimas k observações de forma igual e ignora completamente todas as observações anteriores. (Voltar ao início da página.) Browns Simple Exponential Smoothing (exponencialmente ponderada) Intuitivamente, os dados passados devem ser descontados de forma mais gradual - por exemplo, a observação mais recente deve ter um pouco mais de peso que a segunda mais recente, ea segunda mais recente deve ter um pouco mais de peso do que a 3ª mais recente, e em breve. O modelo de suavização exponencial simples (SES) realiza isso. Vamos 945 denotar uma constante quotsmoothingquot (um número entre 0 e 1). Uma maneira de escrever o modelo é definir uma série L que represente o nível atual (isto é, o valor médio local) da série, conforme estimado a partir dos dados até o presente. O valor de L no tempo t é calculado recursivamente a partir de seu próprio valor anterior como este: Assim, o valor suavizado atual é uma interpolação entre o valor suavizado anterior e a observação atual, onde 945 controla a proximidade do valor interpolado para o mais recente observação. A previsão para o próximo período é simplesmente o valor suavizado atual: Equivalentemente, podemos expressar a próxima previsão diretamente em termos de previsões anteriores e observações anteriores, em qualquer uma das seguintes versões equivalentes. Na primeira versão, a previsão é uma interpolação entre previsão anterior e observação anterior: Na segunda versão, a próxima previsão é obtida ajustando a previsão anterior na direção do erro anterior por uma fração 945. é o erro feito em Tempo t. Na terceira versão, a previsão é uma média móvel exponencialmente ponderada (ou seja, descontada) com o fator de desconto 1- 945: A versão de interpolação da fórmula de previsão é a mais simples de usar se você estiver implementando o modelo em uma planilha: ela se encaixa em um Célula única e contém referências de células que apontam para a previsão anterior, a observação anterior ea célula onde o valor de 945 é armazenado. Observe que se 945 1, o modelo SES é equivalente a um modelo de caminhada aleatória (sem crescimento). Se 945 0, o modelo SES é equivalente ao modelo médio, assumindo que o primeiro valor suavizado é definido igual à média. A idade média dos dados na previsão de suavização exponencial simples é de 1 945 em relação ao período para o qual a previsão é calculada. (Isso não é suposto ser óbvio, mas pode ser facilmente demonstrado pela avaliação de uma série infinita.) Portanto, a previsão média móvel simples tende a ficar para trás de pontos de viragem em cerca de 1 945 períodos. Por exemplo, quando 945 0,5 o atraso é 2 períodos quando 945 0,2 o atraso é de 5 períodos quando 945 0,1 o atraso é de 10 períodos, e assim por diante. Para uma determinada idade média (isto é, a quantidade de atraso), a previsão de suavização exponencial simples (SES) é um pouco superior à previsão de média móvel simples (SMA) porque coloca relativamente mais peso na observação mais recente - i. e. É ligeiramente mais quotresponsivequot às mudanças que ocorrem no passado recente. Por exemplo, um modelo SMA com 9 termos e um modelo SES com 945 0,2 têm uma idade média de 5 para os dados nas suas previsões, mas o modelo SES coloca mais peso nos últimos 3 valores do que o modelo SMA e no modelo SMA. Uma outra vantagem importante do modelo SES sobre o modelo SMA é que o modelo SES usa um parâmetro de suavização que é continuamente variável, de modo que pode ser facilmente otimizado Usando um algoritmo quotsolverquot para minimizar o erro quadrático médio. O valor óptimo de 945 no modelo SES para esta série revela-se 0.2961, como mostrado aqui: A idade média dos dados nesta previsão é 10.2961 3.4 períodos, que é semelhante ao de uma média móvel simples de 6-termo. As previsões a longo prazo do modelo SES são uma linha reta horizontal. Como no modelo SMA e no modelo randômico sem crescimento. No entanto, note que os intervalos de confiança calculados por Statgraphics agora divergem de uma forma razoável, e que eles são substancialmente mais estreitos do que os intervalos de confiança para o modelo de caminhada aleatória. O modelo SES assume que a série é um tanto quotmore previsível do que o modelo de caminhada aleatória. Um modelo SES é realmente um caso especial de um modelo ARIMA. Assim a teoria estatística dos modelos ARIMA fornece uma base sólida para o cálculo de intervalos de confiança para o modelo SES. Em particular, um modelo SES é um modelo ARIMA com uma diferença não sazonal, um termo MA (1) e nenhum termo constante. Também conhecido como um modelo quotARIMA (0,1,1) sem constantequot. O coeficiente MA (1) no modelo ARIMA corresponde à quantidade 1-945 no modelo SES. Por exemplo, se você ajustar um modelo ARIMA (0,1,1) sem constante para a série aqui analisada, o coeficiente MA estimado (1) resulta ser 0,7029, que é quase exatamente um menos 0,2961. É possível adicionar a hipótese de uma tendência linear constante não-zero para um modelo SES. Para fazer isso, basta especificar um modelo ARIMA com uma diferença não sazonal e um termo MA (1) com uma constante, ou seja, um modelo ARIMA (0,1,1) com constante. As previsões a longo prazo terão então uma tendência que é igual à tendência média observada durante todo o período de estimação. Você não pode fazer isso em conjunto com o ajuste sazonal, porque as opções de ajuste sazonal são desativadas quando o tipo de modelo é definido como ARIMA. No entanto, você pode adicionar uma tendência exponencial de longo prazo constante a um modelo de suavização exponencial simples (com ou sem ajuste sazonal) usando a opção de ajuste de inflação no procedimento de Previsão. A taxa adequada de inflação (crescimento percentual) por período pode ser estimada como o coeficiente de declive num modelo de tendência linear ajustado aos dados em conjunto com uma transformação de logaritmo natural, ou pode basear-se em outra informação independente sobre as perspectivas de crescimento a longo prazo . (Voltar ao início da página.) Browns Linear (ie duplo) Suavização exponencial Os modelos SMA e SES assumem que não há tendência de qualquer tipo nos dados (o que normalmente é OK ou pelo menos não muito ruim para 1- Antecipadamente quando os dados são relativamente ruidosos), e podem ser modificados para incorporar uma tendência linear constante como mostrado acima. O que acontece com as tendências de curto prazo Se uma série exibir uma taxa de crescimento variável ou um padrão cíclico que se destaque claramente contra o ruído, e se houver uma necessidade de prever mais do que um período à frente, a estimativa de uma tendência local também pode ser um problema. O modelo de suavização exponencial simples pode ser generalizado para obter um modelo linear de suavização exponencial (LES) que calcula estimativas locais de nível e tendência. O modelo de tendência de variação de tempo mais simples é o modelo de alisamento exponencial linear de Browns, que usa duas séries suavizadas diferentes que são centradas em diferentes pontos do tempo. A fórmula de previsão é baseada em uma extrapolação de uma linha através dos dois centros. (Uma versão mais sofisticada deste modelo, Holt8217s, é discutida abaixo.) A forma algébrica do modelo de suavização exponencial linear de Brown8217s, como a do modelo de suavização exponencial simples, pode ser expressa em um número de formas diferentes mas equivalentes. A forma quotstandard deste modelo é usualmente expressa da seguinte maneira: Seja S a série de suavização simples obtida aplicando-se a suavização exponencial simples à série Y. Ou seja, o valor de S no período t é dado por: (Lembre-se que, Exponencial, esta seria a previsão para Y no período t1.) Então deixe Squot denotar a série duplamente-alisada obtida aplicando a suavização exponencial simples (usando o mesmo 945) à série S: Finalmente, a previsão para Y tk. Para qualquer kgt1, é dada por: Isto resulta em e 1 0 (isto é, enganar um pouco, e deixar a primeira previsão igual à primeira observação real) e e 2 Y 2 8211 Y 1. Após o que as previsões são geradas usando a equação acima. Isto produz os mesmos valores ajustados que a fórmula baseada em S e S se estes últimos foram iniciados utilizando S 1 S 1 Y 1. Esta versão do modelo é usada na próxima página que ilustra uma combinação de suavização exponencial com ajuste sazonal. Holt8217s Linear Exponential Smoothing Brown8217s O modelo LES calcula as estimativas locais de nível e tendência ao suavizar os dados recentes, mas o fato de que ele faz isso com um único parâmetro de suavização coloca uma restrição nos padrões de dados que é capaz de ajustar: o nível ea tendência Não podem variar em taxas independentes. Holt8217s modelo LES aborda esta questão, incluindo duas constantes de alisamento, um para o nível e um para a tendência. At any time t, as in Brown8217s model, the there is an estimate L t of the local level and an estimate T t of the local trend. Aqui eles são calculados recursivamente a partir do valor de Y observado no tempo t e as estimativas anteriores do nível e tendência por duas equações que aplicam alisamento exponencial para eles separadamente. Se o nível estimado ea tendência no tempo t-1 são L t82091 e T t-1. Respectivamente, então a previsão para Y tshy que teria sido feita no tempo t-1 é igual a L t-1 T t-1. Quando o valor real é observado, a estimativa atualizada do nível é calculada recursivamente pela interpolação entre Y tshy e sua previsão, L t-1 T t-1, usando pesos de 945 e 1-945. A mudança no nível estimado, Nomeadamente L t 8209 L t82091. Pode ser interpretado como uma medida ruidosa da tendência no tempo t. A estimativa actualizada da tendência é então calculada recursivamente pela interpolação entre L t 8209 L t82091 e a estimativa anterior da tendência, T t-1. Usando pesos de 946 e 1-946: A interpretação da constante de suavização de tendência 946 é análoga à da constante de suavização de nível 945. Modelos com valores pequenos de 946 assumem que a tendência muda apenas muito lentamente ao longo do tempo, enquanto modelos com Maior 946 supor que está mudando mais rapidamente. Um modelo com um grande 946 acredita que o futuro distante é muito incerto, porque os erros na estimativa de tendência tornam-se bastante importantes quando se prevê mais de um período à frente. As constantes de suavização 945 e 946 podem ser estimadas da maneira usual minimizando o erro quadrático médio das previsões de 1 passo à frente. Quando isso é feito em Statgraphics, as estimativas se tornam 945 0,3048 e 946 0,008. O valor muito pequeno de 946 significa que o modelo assume muito pouca mudança na tendência de um período para o outro, então basicamente este modelo está tentando estimar uma tendência de longo prazo. Por analogia com a noção de idade média dos dados que é utilizada na estimativa do nível local da série, a idade média dos dados que são utilizados na estimativa da tendência local é proporcional a 1 946, embora não exatamente igual a . Neste caso, isto é 10.006 125. Isto não é um número muito preciso, na medida em que a precisão da estimativa de 946 é realmente de 3 casas decimais, mas é da mesma ordem geral de magnitude que o tamanho da amostra de 100, portanto Este modelo está calculando a média sobre bastante muita história em estimar a tendência. O gráfico de previsão abaixo mostra que o modelo LES estima uma tendência local ligeiramente maior no final da série do que a tendência constante estimada no modelo SEStrend. Além disso, o valor estimado de 945 é quase idêntico ao obtido pela montagem do modelo SES com ou sem tendência, de modo que este é quase o mesmo modelo. Agora, eles parecem previsões razoáveis para um modelo que é suposto ser estimar uma tendência local Se você 8220eyeball8221 esse enredo, parece que a tendência local virou para baixo no final da série O que aconteceu Os parâmetros deste modelo Foram calculados minimizando o erro quadrático das previsões de um passo à frente, e não as previsões a mais longo prazo, caso em que a tendência não faz muita diferença. Se tudo o que você está olhando são 1-passo-frente erros, você não está vendo a imagem maior de tendências sobre (digamos) 10 ou 20 períodos. A fim de obter este modelo mais em sintonia com a nossa extrapolação do globo ocular dos dados, podemos ajustar manualmente a tendência de alisamento constante para que ele usa uma linha de base mais curto para a estimativa de tendência. Por exemplo, se escolhemos definir 946 0,1, então a idade média dos dados usados na estimativa da tendência local é de 10 períodos, o que significa que estamos fazendo a média da tendência ao longo dos últimos 20 períodos. Here8217s o que o lote de previsão parece se definimos 946 0,1, mantendo 945 0,3. Isso parece intuitivamente razoável para esta série, embora seja provavelmente perigoso para extrapolar esta tendência mais de 10 períodos no futuro. E sobre as estatísticas de erro Aqui está uma comparação de modelos para os dois modelos mostrados acima, bem como três modelos SES. O valor ótimo de 945 para o modelo SES é de aproximadamente 0,3, mas resultados semelhantes (com ligeiramente mais ou menos responsividade, respectivamente) são obtidos com 0,5 e 0,2. (A) Holts linear exp. Alisamento com alfa 0,3048 e beta 0,008 (B) Holts linear exp. Alisamento com alfa 0,3 e beta 0,1 (C) Suavização exponencial simples com alfa 0,5 (D) Suavização exponencial simples com alfa 0,3 (E) Suavização exponencial simples com alfa 0,2 Suas estatísticas são quase idênticas, portanto, realmente não podemos fazer a escolha com base De erros de previsão de 1 passo à frente dentro da amostra de dados. Temos de recorrer a outras considerações. Se acreditarmos firmemente que faz sentido basear a estimativa da tendência atual sobre o que aconteceu nos últimos 20 períodos, podemos fazer um caso para o modelo LES com 945 0,3 e 946 0,1. Se queremos ser agnósticos quanto à existência de uma tendência local, então um dos modelos do SES pode ser mais fácil de explicar e também dar mais previsões de médio-caminho para os próximos 5 ou 10 períodos. Evidências empíricas sugerem que, se os dados já tiverem sido ajustados (se necessário) para a inflação, então pode ser imprudente extrapolar os resultados lineares de curto prazo Muito para o futuro. As tendências evidentes hoje podem afrouxar no futuro devido às causas variadas tais como a obsolescência do produto, a competição aumentada, e os abrandamentos cíclicos ou as ascensões em uma indústria. Por esta razão, a suavização exponencial simples geralmente desempenha melhor fora da amostra do que poderia ser esperado, apesar de sua extrapolação de tendência horizontal quotnaivequot. Modificações de tendência amortecida do modelo de suavização exponencial linear também são freqüentemente usadas na prática para introduzir uma nota de conservadorismo em suas projeções de tendência. O modelo LES com tendência a amortecimento pode ser implementado como um caso especial de um modelo ARIMA, em particular, um modelo ARIMA (1,1,2). É possível calcular intervalos de confiança em torno de previsões de longo prazo produzidas por modelos exponenciais de suavização, considerando-os como casos especiais de modelos ARIMA. A largura dos intervalos de confiança depende de (i) o erro RMS do modelo, (ii) o tipo de suavização (simples ou linear) (iii) o valor (S) da (s) constante (s) de suavização e (iv) o número de períodos à frente que você está prevendo. Em geral, os intervalos se espalham mais rapidamente à medida que o 945 fica maior no modelo SES e eles se espalham muito mais rápido quando se usa linear ao invés de alisamento simples. Este tópico é discutido mais adiante na seção de modelos ARIMA das notas. (Return to top of page.)
No comments:
Post a Comment