Estatística para Concurso

Eu Quero Acessar

Entropia em Estatística: Fórmula, Cálculo e Exercícios

Tempo de leitura: 13 min

Escrito por Anselmo Alves

Quero Ficar Informado

Junte-se à lista Vip! Receba conteúdos exclusivos do mundo de estatística para concurso.

Seus dados estão seguros!

Compartilhar:

Entropia em Estatística: Fórmula, Cálculo e Exercícios

A entropia em estatística é a medida de incerteza de uma variável aleatória. Quanto mais imprevisível é o resultado, maior a entropia. Quanto mais próximo da certeza, menor. É um conceito que saiu da teoria da informação e hoje aparece em prova de Ciência de Dados, Estatística e TI, principalmente em questões sobre árvores de decisão e medidas de impureza.

Neste artigo você vai ver a fórmula de Shannon, o cálculo passo a passo em bits, as propriedades que a banca adora cobrar, a generalização de Rényi e questões comentadas, incluindo uma da ABIN.

Definição direta

A entropia mede a quantidade média de informação necessária para descrever o resultado de uma variável aleatória. Ela depende apenas das probabilidades, nunca dos valores que a variável assume.

A fórmula da entropia em estatística segundo Shannon

Para uma variável aleatória discreta X com n resultados possíveis, a entropia é:

H(X) = − Σi=1n P(xi) · logb P(xi)

Onde:

Símbolo Significado
H(X) Entropia da variável X, sempre maior ou igual a zero
P(xi) Probabilidade do resultado xi ocorrer
n Número de resultados possíveis
b Base do logaritmo, que define a unidade de medida

O sinal negativo existe porque o logaritmo de um número entre 0 e 1 é sempre negativo. Ele apenas garante que a entropia saia positiva.

A base do logaritmo muda a unidade, não a ordenação

Base Unidade Uso típico
b = 2 bits Padrão em concurso, computação e machine learning
b = e nats Deduções teóricas e estatística matemática
b = 10 hartleys Raro, aparece em textos antigos

Atenção da banca: se o enunciado não informa a base, assuma b = 2 e responda em bits. Se a questão citar “logaritmo neperiano” ou usar a notação ln, a resposta sai em nats. Esse detalhe já foi decisivo em prova da ABIN, como você verá adiante.

Como calcular a entropia passo a passo

Exemplo 1: moeda honesta

Uma moeda equilibrada tem P(cara) = P(coroa) = 0,5. Aplicando a fórmula:

H(X) = − [ 0,5 · log2 0,5 + 0,5 · log2 0,5 ]

Como log2 0,5 = −1:

H(X) = − [ 0,5 · (−1) + 0,5 · (−1) ] = −(−1) = 1 bit

Esse é o caso de incerteza máxima para duas alternativas. Você precisa de exatamente 1 bit de informação para saber o resultado.

Exemplo 2: moeda viciada

Agora P(cara) = 0,9 e P(coroa) = 0,1:

H(X) = − [ 0,9 · log2 0,9 + 0,1 · log2 0,1 ]

Com log2 0,9 ≈ −0,152 e log2 0,1 ≈ −3,322:

H(X) = 0,9 · 0,152 + 0,1 · 3,322 = 0,137 + 0,332 ≈ 0,469 bit

A leitura que importa: a entropia caiu de 1 bit para 0,469 bit. Faz sentido, porque a moeda viciada é mais previsível. Menos incerteza significa menos entropia. Se o vício fosse total, com P(cara) = 1, a entropia seria zero.

Exemplo 3: variável com quatro categorias

Considere probabilidades iguais a 1/2, 1/4, 1/8 e 1/8:

H(X) = 0,5(1) + 0,25(2) + 0,125(3) + 0,125(3) = 1,75 bits

Se as quatro categorias fossem equiprováveis, teríamos H = log2 4 = 2 bits, o valor máximo possível para quatro resultados. Isso ilustra a propriedade mais cobrada em prova.

Propriedades que a banca cobra

Propriedade Enunciado
Não negatividade H(X) ≥ 0 sempre. Entropia nunca é negativa.
Entropia mínima H(X) = 0 quando um resultado tem probabilidade 1. Certeza absoluta, zero incerteza.
Entropia máxima H(X) = logb n quando a distribuição é uniforme.
Invariância aos valores Trocar rótulos ou valores da variável não altera a entropia. Só as probabilidades importam.
Convenção do zero Por definição, 0 · log 0 = 0. Categorias com probabilidade zero não somam nada.
Aditividade Se X e Y são independentes, H(X,Y) = H(X) + H(Y).

A propriedade que mais derruba candidato

A entropia da distribuição uniforme é o teto. Se a questão pergunta qual distribuição maximiza a incerteza entre n resultados, a resposta é sempre a uniforme, com H = log2 n. Guarde isso.

Entropia de Rényi: a generalização que já caiu na ABIN

A entropia de Shannon é apenas um caso particular de uma família mais ampla, chamada entropia de Rényi de ordem q:

Hq(X) = [ 1 / (1 − q) ] · ln ( Σi=1n piq )    com q > 0 e q ≠ 1

O parâmetro q controla o peso dado a cada evento. Valores baixos valorizam eventos raros. Valores altos concentram a atenção no evento mais provável. Quando q tende a 1, a expressão converge para a entropia de Shannon.

A propriedade que resolve a questão sem conta

Na distribuição uniforme, todas as entropias de Rényi valem ln n, independentemente de q. É o único caso em que a ordem q não faz diferença alguma. Em qualquer outra distribuição, o valor muda conforme q.

Entropia condicional e ganho de informação

Aqui está o ponto que aparece nas provas de Ciência de Dados. A entropia condicional mede a incerteza que resta sobre Y depois que você conhece X:

H(Y | X) = Σx P(x) · H(Y | X = x)

A partir dela define-se o ganho de informação, que é a redução de incerteza obtida ao usar uma variável explicativa:

IG(Y, X) = H(Y) − H(Y | X)

É exatamente esse o critério usado pelos algoritmos ID3 e C4.5 para escolher em qual variável dividir cada nó de uma árvore de decisão. A cada divisão, o algoritmo seleciona a variável com maior ganho de informação, ou seja, a que mais reduz a incerteza sobre a classe alvo.

Entropia versus impureza de Gini

Critério Fórmula Máximo com 2 classes
Entropia − Σ pi log2 pi 1,0
Impureza de Gini 1 − Σ pi2 0,5

Pegadinha clássica: a impureza de Gini das árvores de decisão não é o índice de Gini de concentração de renda. São medidas diferentes, com fórmulas diferentes, que apenas compartilham o nome do mesmo autor. Se a questão fala em desigualdade e curva de Lorenz, é o de concentração. Se fala em nó, divisão ou classificação, é o de impureza.

Onde a entropia aparece na prática

  • Árvores de decisão: critério de divisão dos nós via ganho de informação
  • Redes neurais: a função de perda cross-entropy deriva diretamente desse conceito
  • Compressão de dados: a entropia é o limite teórico mínimo de bits por símbolo
  • Seleção de variáveis: informação mútua para escolher preditores relevantes
  • Ecologia e demografia: índice de diversidade de Shannon
  • Inferência bayesiana: princípio da máxima entropia para escolher prioris pouco informativas

O conceito foi formalizado por Claude Shannon em 1948, no artigo A Mathematical Theory of Communication, texto fundador da teoria da informação.

Erros mais comuns na hora da prova

  1. Confundir entropia com variância. A variância mede dispersão em torno da média e exige variável numérica. A entropia mede incerteza e funciona também com variável qualitativa, porque só usa probabilidades.
  2. Achar que valores altos da variável elevam a entropia. Não elevam. Multiplicar todos os valores por mil não muda nada.
  3. Errar a base do logaritmo. Responder em nats quando a questão pede bits derruba a alternativa.
  4. Esquecer o sinal negativo e chegar a uma entropia negativa, o que é impossível no caso discreto.
  5. Tratar 0 · log 0 como indefinido em vez de aplicar a convenção de que vale zero.

Questões comentadas

Questão 1 (Cebraspe, ABIN)

Considere que a variável aleatória X possa assumir n valores diferentes com probabilidades p1, p2, …, pn, respectivamente, em que n ≥ 2. A respeito das expressões das entropias de ordem q de Shannon e de Rényi associadas a X, e sabendo que ambas utilizam o logaritmo neperiano, julgue o item a seguir.

Se todas as probabilidades pi (i = 1, …, n) forem iguais, então a entropia de Shannon e a entropia de Rényi serão iguais a ln(n), para qualquer valor de q.

Ver gabarito comentado

Gabarito: CERTO.

Passo 1. Entropia de Shannon na uniforme. Substituindo pi = 1/n para todo i:

H = − Σi=1n (1/n) · ln (1/n) = − ln (1/n) = ln n

Passo 2. Somatório da entropia de Rényi. Cada termo elevado a q vale n−q, e são n termos iguais:

Σi=1n (1/n)q = n · n−q = n1−q

Passo 3. Substituição na fórmula de Rényi.

Hq = [ 1 / (1 − q) ] · ln ( n1−q ) = [ (1 − q) / (1 − q) ] · ln n = ln n

O fator (1 − q) cancela e o resultado independe de q. Para q = 1, a entropia de Rényi é definida pelo limite, que converge exatamente para a de Shannon, também ln n. Item certo.

A armadilha: o candidato tenta testar valores de q em vez de fazer o cancelamento algébrico e perde tempo. Repare também que a banca avisou sobre o logaritmo neperiano, então a resposta sai em nats, não em bits. A distribuição uniforme é o único caso em que todas as entropias de Rényi coincidem.

Questão 2 (IADES)

H(X) [entropia de Shannon] pode ser vista como uma medida da quantidade média de informação contida em X ou, de forma equivalente, a quantidade de incerteza que existe até o valor de X ser revelado.

BLOCH, M.; BARROS, J. Physical-layer security: from information theory to security engineering. Cambridge: Cambridge University Press, 2011. Tradução livre.

Acerca da entropia de Shannon, e sendo X uma variável discreta aleatória, assinale a alternativa correta.

a) H(X) pode ter valores positivos e negativos. Quanto maior o valor de H(X), menos incerteza existe no sistema.

b) H(X) pode ter qualquer valor positivo, não tendo valor limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), menos incerteza existe no sistema.

c) H(X) tem um valor positivo e limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), menos incerteza existe no sistema.

d) H(X) pode ter qualquer valor positivo, não tendo valor limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), mais incerteza existe no sistema.

e) H(X) tem um valor positivo e limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), mais incerteza existe no sistema.

Ver gabarito comentado

Gabarito: letra E.

A questão testa duas propriedades ao mesmo tempo. Analise cada uma separadamente e as alternativas caem sozinhas.

Propriedade 1: a entropia é não negativa e tem teto. Como toda probabilidade fica entre 0 e 1, a fórmula sempre devolve valor maior ou igual a zero. E o valor máximo depende justamente da quantidade de resultados possíveis:

0 ≤ H(X) ≤ log n

Ou seja, H(X) é limitada pelo número de valores distintos de X. Isso elimina de imediato as alternativas B e D, que negam a existência de limite.

Propriedade 2: mais entropia significa mais incerteza. A entropia mede imprevisibilidade. Quando um resultado é certo, a entropia é zero. Quando todos são equiprováveis, ela atinge o máximo. Portanto, valor alto de H(X) indica mais incerteza, não menos. Isso derruba as alternativas A e C.

Resta a letra E, que acerta as duas propriedades. A alternativa A ainda erra duas vezes, porque também afirma que a entropia pode ser negativa, o que é impossível no caso discreto.

A armadilha: a banca combinou duas propriedades independentes nas cinco alternativas para punir quem sabe só metade do conteúdo. Um rigor a mais: a entropia é, na verdade, não negativa, podendo valer exatamente zero quando um resultado tem probabilidade 1. A banca escreveu “valor positivo” em sentido amplo, e nenhuma alternativa explora esse detalhe, então ele não muda o gabarito.

Você entende a teoria, mas trava na hora de resolver a questão?

Isso acontece com quase todo candidato, e não é falta de inteligência. É método. No curso Estatística para Concurso você aprende a reconhecer o que a banca está cobrando e resolver com segurança, do conceito básico até os temas avançados que aparecem nos editais de Ciência de Dados.

Quero conhecer o curso

Perguntas frequentes

Entropia pode ser negativa?

Não, no caso discreto. Como toda probabilidade está entre 0 e 1, o logaritmo é negativo e o sinal da fórmula inverte esse resultado. Em variáveis contínuas, a entropia diferencial pode assumir valores negativos, mas isso raramente é cobrado em concurso.

Qual a diferença entre entropia e variância?

A variância mede o quanto os valores se afastam da média e exige variável numérica. A entropia mede incerteza usando apenas as probabilidades, então funciona também para variáveis qualitativas, como cor, região ou categoria de resposta.

Qual distribuição tem entropia máxima?

No caso discreto com n resultados, a uniforme, com H = log2 n. Entre distribuições contínuas com média e variância fixadas, a normal é a de máxima entropia. Já no suporte positivo com média fixada, a exponencial ocupa esse papel.

O que é entropia de Rényi e por que ela cai em prova?

É uma generalização da entropia de Shannon, controlada por um parâmetro q que ajusta o peso dado a eventos raros ou frequentes. Shannon é o caso limite quando q tende a 1. Cai em provas de inteligência e ciência de dados, como já ocorreu na ABIN.

Preciso decorar valores de logaritmo para a prova?

Poucos. Vale memorizar log2 0,5 = −1, log2 0,25 = −2, log2 0,125 = −3, log2 2 = 1, log2 4 = 2 e log2 8 = 3. A maioria das questões usa probabilidades que são potências de 2 justamente para permitir cálculo sem calculadora.

Entropia cai em concurso de estatística ou só de TI?

Cai nos dois. Em provas de TI e Ciência de Dados aparece ligada a árvores de decisão e aprendizado de máquina. Em provas de Estatística surge em teoria da informação, medidas de diversidade e no princípio da máxima entropia. Editais recentes com ênfase em Ciência de Dados aumentaram bastante a frequência do tema.

Checklist de revisão

  • Fórmula de Shannon: H(X) = − Σ P(xi) logb P(xi)
  • Unidade padrão: bits, com base 2. Com ln, a resposta sai em nats
  • Entropia mínima: zero, quando há certeza
  • Entropia máxima: log2 n, na distribuição uniforme
  • Depende só das probabilidades, nunca dos valores
  • Rényi na uniforme: ln n para qualquer q
  • Ganho de informação: IG = H(Y)H(Y|X)
  • Impureza de Gini das árvores é diferente do Gini de concentração

Continue estudando

  • A Mathematical Theory of Communication
  • Se este conteúdo te ajudou, compartilhe com quem também está estudando para concurso e deixe sua dúvida nos comentários.

    Compartilhar:

    Você vai gostar também:

    Para enviar seu comentário, preencha os campos abaixo:

    Deixe um comentário


    *


    *


    Seja o primeiro a comentar!

    Damos valor à sua privacidade

    Nós e os nossos parceiros armazenamos ou acedemos a informações dos dispositivos, tais como cookies, e processamos dados pessoais, tais como identificadores exclusivos e informações padrão enviadas pelos dispositivos, para as finalidades descritas abaixo. Poderá clicar para consentir o processamento por nossa parte e pela parte dos nossos parceiros para tais finalidades. Em alternativa, poderá clicar para recusar o consentimento, ou aceder a informações mais pormenorizadas e alterar as suas preferências antes de dar consentimento. As suas preferências serão aplicadas apenas a este website.

    Cookies estritamente necessários

    Estes cookies são necessários para que o website funcione e não podem ser desligados nos nossos sistemas. Normalmente, eles só são configurados em resposta a ações levadas a cabo por si e que correspondem a uma solicitação de serviços, tais como definir as suas preferências de privacidade, iniciar sessão ou preencher formulários. Pode configurar o seu navegador para bloquear ou alertá-lo(a) sobre esses cookies, mas algumas partes do website não funcionarão. Estes cookies não armazenam qualquer informação pessoal identificável.

    Cookies de desempenho

    Estes cookies permitem-nos contar visitas e fontes de tráfego, para que possamos medir e melhorar o desempenho do nosso website. Eles ajudam-nos a saber quais são as páginas mais e menos populares e a ver como os visitantes se movimentam pelo website. Todas as informações recolhidas por estes cookies são agregadas e, por conseguinte, anónimas. Se não permitir estes cookies, não saberemos quando visitou o nosso site.

    Cookies de funcionalidade

    Estes cookies permitem que o site forneça uma funcionalidade e personalização melhoradas. Podem ser estabelecidos por nós ou por fornecedores externos cujos serviços adicionámos às nossas páginas. Se não permitir estes cookies algumas destas funcionalidades, ou mesmo todas, podem não atuar corretamente.

    Cookies de publicidade

    Estes cookies podem ser estabelecidos através do nosso site pelos nossos parceiros de publicidade. Podem ser usados por essas empresas para construir um perfil sobre os seus interesses e mostrar-lhe anúncios relevantes em outros websites. Eles não armazenam diretamente informações pessoais, mas são baseados na identificação exclusiva do seu navegador e dispositivo de internet. Se não permitir estes cookies, terá menos publicidade direcionada.

    Visite as nossas páginas de Políticas de privacidade e Termos e condições.

    Importante: Este site faz uso de cookies para melhorar sua experiência de navegação e recomendar conteúdo.

    Estatística para Concurso

    Sua preparação Indispensável para qualquer concurso público!

    Um curso compacto com a profundidade necessária. Forte base teórica com encadeamento lógico. FÓRMULAS? Não se preocupe com elas! Você vai construir seu conhecimento para não depender de ficar decorando! Acesse já!