F2 · Aulas 41–42

Noções básicas de Estatística

Medidas de posição

Resumem onde os dados se concentram: média, mediana e moda. Em distribuição simétrica coincidem; com valores extremos (outliers), separam-se — e aí a mediana representa melhor o conjunto. Escolher a medida adequada é o que a Unicamp costuma cobrar por escrito.

Aprofundar

As medidas de posição vão além da simples localização do centro: cada uma captura uma noção distinta de "valor típico". A média aritmética é o ponto de equilíbrio dos dados, obtida somando todos os valores e dividindo pela quantidade; ela usa toda a informação disponível, mas é justamente por isso que qualquer valor extremo a desloca. A mediana é o valor que divide o conjunto ordenado em duas metades iguais: com número ímpar de dados, é o termo central; com número par, é a média dos dois centrais. Já a moda é o valor mais frequente, podendo haver mais de uma (bimodal, multimodal) ou nenhuma em conjuntos sem repetições. Vale conhecer ainda as medidas separatrizes — quartis, decis e percentis —, que generalizam a mediana ao dividir os dados em partes iguais; o primeiro quartil, por exemplo, deixa 25% dos dados abaixo dele, e é peça-chave na construção do boxplot.

Média aritmética

$\bar{x}=\frac{\sum x_{i}}{n}$; ponderada, $\frac{\sum p_{i}x_{i}}{\sum p_{i}}$. Usa todos os dados, por isso é sensível a extremos. Propriedade útil: somar $k$ a todos aumenta a média em $k$; multiplicar por $k$ multiplica a média por $k$.

Aprofundar

A média aritmética é o valor de equilíbrio de um conjunto de dados: se pensarmos em cada valor como um peso colocado sobre uma régua, a média é exatamente o ponto de apoio em que a régua fica nivelada, o que explica por que dados discrepantes deslocam o resultado para o lado dos extremos. Uma propriedade fundamental que complementa o resumo é a dos desvios: a soma de todos os desvios em relação à média é sempre zero, ou seja, $\sum (x_{i}-\bar{x})=0$, e é essa característica que torna a média a referência natural para medir dispersão, como veremos em variância e desvio padrão. Além disso, quando agrupamos os dados em uma tabela de frequências, a média ponderada usa como pesos justamente as frequências de cada valor, o que nada mais é do que uma forma eficiente de somar dados repetidos sem contá-los um a um.

Para ilustrar, considere as notas de um aluno em quatro provas com pesos distintos: 6 (peso 2), 8 (peso 3), 5 (peso 1) e 9 (peso 4); a média ponderada é $\frac{6\cdot2+8\cdot3+5\cdot1+9\cdot4}{2+3+1+4}=\frac{12+24+5+36}{10}=7,7$, valor bem diferente da média simples, que seria 7,0. Isso mostra que a escolha dos pesos muda completamente a leitura do desempenho, algo que aparece em questões de vestibulares como a Fuvest e a Unicamp, geralmente contextualizadas em boletins escolares, índices de inflação ou médias de consumo.

Mediana

Valor central dos dados ordenados; com $n$ par, é a média dos dois centrais. Ordenar primeiro é o passo que muita gente pula. Resistente a outliers — por isso se usa mediana de renda, e não média, em análises socioeconômicas.

Aprofundar

A mediana é, antes de tudo, uma medida de posição que divide o conjunto em duas metades: pelo menos 50% dos dados ficam abaixo ou iguais a ela e pelo menos 50% ficam acima ou iguais. Essa definição vale tanto para dados brutos quanto para distribuições agrupadas, e é justamente aí que a Fuvest e a Unicamp costumam apertar o cerco. Em uma tabela de frequências com classes, por exemplo, calcula-se a mediana por interpolação linear dentro da classe mediana, usando a fórmula $Md = L_i + \frac{\frac{n}{2} - F_{ac}}{f_m} \cdot h$, em que $L_i$ é o limite inferior da classe mediana, $F_{ac}$ a frequência acumulada anterior, $f_m$ a frequência da classe e $h$ sua amplitude.

Dominar a mediana, portanto, é menos decorar fórmula e mais entender que ela responde à pergunta “qual é o centro real desse conjunto?”, preparando você para resolver tanto questões numéricas quanto aquelas que exigem leitura crítica de dados sociais.

Moda

Valor mais frequente. Pode não existir, ou haver várias (bimodal, multimodal). É a única medida aplicável a dados qualitativos — cor preferida, marca mais vendida. Em tabelas de frequência, é a classe de maior frequência.

Aprofundar

Na prática, a moda é a medida de posição mais simples de calcular e a mais resistente: como depende apenas da repetição de valores, não é afetada por valores extremos, o que a torna útil quando há outliers — imagine as notas de uma turma em que quase todos tiraram entre 5 e 7, mas um aluno tirou 0 e outro tirou 10; a média cai ou sobe artificialmente, enquanto a moda permanece no valor típico. Em distribuições agrupadas em classes, quando o enunciado pede um valor pontual e não apenas a classe modal, recorre-se à moda de Czuber, que faz uma interpolação dentro da classe de maior frequência para estimar onde, dentro dela, o valor modal se concentra; é justamente esse refinamento que diferencia a moda da simples identificação da classe, e é o que costuma aparecer em questões de estatística descritiva mais elaboradas.

Vale lembrar ainda que a moda pode não ser única: um conjunto com duas categorias empatadas no topo de frequência é bimodal, e com três ou mais, multimodal, caso em que indicar "a moda" é um equívoco conceitual — por isso, ao resolver uma questão, é prudente verificar se há empate antes de apresentar uma única resposta como definitiva.

Medidas de dispersão

Medem o espalhamento em torno da média: amplitude, desvio médio, variância e desvio padrão. Duas amostras podem ter a mesma média e dispersões muito diferentes — daí gráficos com médias iguais serem distinguidos apenas pela dispersão.

Aprofundar

As medidas de dispersão quantificam o quanto os dados se afastam do centro, e por isso são essenciais para comparar conjuntos que podem ter médias idênticas mas comportamentos distintos. A amplitude é a diferença entre o maior e o menor valor: simples e rápida, mas frágil, pois ignora todos os dados intermediários e é muito sensível a valores extremos. O desvio médio calcula a média dos módulos das diferenças entre cada valor e a média aritmética, corrigindo o problema dos desvios negativos e positivos que se anulariam; ainda assim, o uso do módulo dificulta manipulações algébricas. A variância resolve isso elevando cada desvio ao quadrado antes de tirar a média, o que penaliza fortemente afastamentos grandes; sua unidade, porém, fica ao quadrado (por exemplo, reais ao quadrado), o que não tem interpretação direta.

O desvio padrão, raiz quadrada da variância, devolve a medida à unidade original e é o mais usado em provas.

Desvio médio

$DM=\frac{\sum|x_{i}-\bar{x}|}{n}$: média das distâncias até a média, em módulo. Sem o módulo, a soma dos desvios seria sempre zero — fato que serve de conferência rápida do cálculo da média.

Aprofundar

O desvio médio mede o quanto, em média, cada valor de um conjunto se afasta da média aritmética, tratando o afastamento sempre como positivo, já que interessa a magnitude da distância, não a direção do desvio: um valor muito acima da média e outro muito abaixo devem pesar igual no resultado. Por isso o módulo é essencial, e é justamente ele que torna o cálculo levemente trabalhoso, exigindo uma passada extra pelos dados antes da divisão final.

Vale notar ainda por que precisamos dele: a soma dos resíduos sem módulo é sempre nula, exatamente porque a média é o ponto de equilíbrio dos dados; o módulo rompe esse cancelamento e permite medir dispersão de verdade. Dois conjuntos com a mesma média podem ter desvios médios bem diferentes: {6, 6, 6, 6, 6} tem $DM=0$, enquanto {3, 5, 6, 7, 9} tem média 6, soma dos desvios em módulo $3+1+0+1+3=8$ e $DM=1,6$ — a mesma média, mas dispersões incomparáveis. Na prática, o desvio médio é menos usado que a variância e o desvio padrão, sobretudo porque o módulo complica o tratamento algébrico e o cálculo diferencial; ainda assim, aparece em provas como conceito de comparação e em questões que pedem interpretação da dispersão de um conjunto.

Em vestibulares como a Fuvest, costuma ser cobrado em problemas de interpretação e comparação entre conjuntos com mesma média, exigindo identificar qual é mais estável, e o ENEM explora contextos cotidianos, como previsibilidade de notas ou temperatura, nos quais o candidato precisa julgar a regularidade dos dados. Já o ITA e a Unicamp, com seu viés analítico, tendem a combiná-lo com propriedades algébricas, pedindo para provar relações entre $DM$ e desvio padrão ou verificar como ele se comporta sob transformações lineares dos dados.

Em resumo, mais importante que decorar a fórmula é entender que o desvio médio quantifica a dispersão absoluta dos dados em torno da média, complementando as medidas de tendência central na leitura completa de um conjunto.

Variância

$\sigma^{2}=\frac{\sum(x_{i}-\bar{x})^{2}}{n}$, e o desvio padrão é $\sigma=\sqrt{\sigma^{2}}$, na unidade original dos dados. Atalho de cálculo: $\sigma^{2}=\overline{x^{2}}-\bar{x}^{2}$. Somar constante não altera $\sigma$; multiplicar por $k$ multiplica $\sigma$ por $|k|$.

Aprofundar

A variância mede o quanto os dados se afastam da média em termos quadráticos, e por isso não é uma simples "média das distâncias": ao elevar ao quadrado, penaliza-se mais os afastamentos grandes e elimina-se o cancelamento entre desvios positivos e negativos, o que faz dela a base de toda a inferência estatística, já que é a medida de dispersão que se decompõe, soma e compara com facilidade.

Vale distinguir população e amostra: quando os dados representam toda a população, divide-se por n, como no resumo; quando são uma amostra extraída de um universo maior, usa-se o estimador não viesado, dividindo por n − 1, artifício que corrige a tendência de subestimar a variabilidade real do universo — na Fuvest e na Unicamp, é comum a questão fornecer os dados e exigir que você identifique pelo enunciado qual caso se aplica, cobrando inclusive a diferença numérica entre os dois resultados. Já no ENEM, a cobrança costuma ser mais conceitual: comparar conjuntos com mesma média e variâncias diferentes para decidir qual é mais regular, estável ou homogêneo, sendo típico o contexto de notas de turmas, tempos de prova ou índices de produção.