
A entropia em estatística é a medida de incerteza de uma variável aleatória. Quanto mais imprevisível é o resultado, maior a entropia. Quanto mais próximo da certeza, menor. É um conceito que saiu da teoria da informação e hoje aparece em prova de Ciência de Dados, Estatística e TI, principalmente em questões sobre árvores de decisão e medidas de impureza.
Neste artigo você vai ver a fórmula de Shannon, o cálculo passo a passo em bits, as propriedades que a banca adora cobrar, a generalização de Rényi e questões comentadas, incluindo uma da ABIN.
Definição direta
A entropia mede a quantidade média de informação necessária para descrever o resultado de uma variável aleatória. Ela depende apenas das probabilidades, nunca dos valores que a variável assume.
A fórmula da entropia em estatística segundo Shannon
Para uma variável aleatória discreta X com n resultados possíveis, a entropia é:
Onde:
| Símbolo | Significado |
|---|---|
| H(X) | Entropia da variável X, sempre maior ou igual a zero |
| P(xi) | Probabilidade do resultado xi ocorrer |
| n | Número de resultados possíveis |
| b | Base do logaritmo, que define a unidade de medida |
O sinal negativo existe porque o logaritmo de um número entre 0 e 1 é sempre negativo. Ele apenas garante que a entropia saia positiva.
A base do logaritmo muda a unidade, não a ordenação
| Base | Unidade | Uso típico |
|---|---|---|
| b = 2 | bits | Padrão em concurso, computação e machine learning |
| b = e | nats | Deduções teóricas e estatística matemática |
| b = 10 | hartleys | Raro, aparece em textos antigos |
Atenção da banca: se o enunciado não informa a base, assuma b = 2 e responda em bits. Se a questão citar “logaritmo neperiano” ou usar a notação ln, a resposta sai em nats. Esse detalhe já foi decisivo em prova da ABIN, como você verá adiante.
Como calcular a entropia passo a passo
Exemplo 1: moeda honesta
Uma moeda equilibrada tem P(cara) = P(coroa) = 0,5. Aplicando a fórmula:
Como log2 0,5 = −1:
Esse é o caso de incerteza máxima para duas alternativas. Você precisa de exatamente 1 bit de informação para saber o resultado.
Exemplo 2: moeda viciada
Agora P(cara) = 0,9 e P(coroa) = 0,1:
Com log2 0,9 ≈ −0,152 e log2 0,1 ≈ −3,322:
A leitura que importa: a entropia caiu de 1 bit para 0,469 bit. Faz sentido, porque a moeda viciada é mais previsível. Menos incerteza significa menos entropia. Se o vício fosse total, com P(cara) = 1, a entropia seria zero.
Exemplo 3: variável com quatro categorias
Considere probabilidades iguais a 1/2, 1/4, 1/8 e 1/8:
Se as quatro categorias fossem equiprováveis, teríamos H = log2 4 = 2 bits, o valor máximo possível para quatro resultados. Isso ilustra a propriedade mais cobrada em prova.
Propriedades que a banca cobra
| Propriedade | Enunciado |
|---|---|
| Não negatividade | H(X) ≥ 0 sempre. Entropia nunca é negativa. |
| Entropia mínima | H(X) = 0 quando um resultado tem probabilidade 1. Certeza absoluta, zero incerteza. |
| Entropia máxima | H(X) = logb n quando a distribuição é uniforme. |
| Invariância aos valores | Trocar rótulos ou valores da variável não altera a entropia. Só as probabilidades importam. |
| Convenção do zero | Por definição, 0 · log 0 = 0. Categorias com probabilidade zero não somam nada. |
| Aditividade | Se X e Y são independentes, H(X,Y) = H(X) + H(Y). |
A propriedade que mais derruba candidato
A entropia da distribuição uniforme é o teto. Se a questão pergunta qual distribuição maximiza a incerteza entre n resultados, a resposta é sempre a uniforme, com H = log2 n. Guarde isso.
Entropia de Rényi: a generalização que já caiu na ABIN
A entropia de Shannon é apenas um caso particular de uma família mais ampla, chamada entropia de Rényi de ordem q:
O parâmetro q controla o peso dado a cada evento. Valores baixos valorizam eventos raros. Valores altos concentram a atenção no evento mais provável. Quando q tende a 1, a expressão converge para a entropia de Shannon.
A propriedade que resolve a questão sem conta
Na distribuição uniforme, todas as entropias de Rényi valem ln n, independentemente de q. É o único caso em que a ordem q não faz diferença alguma. Em qualquer outra distribuição, o valor muda conforme q.
Entropia condicional e ganho de informação
Aqui está o ponto que aparece nas provas de Ciência de Dados. A entropia condicional mede a incerteza que resta sobre Y depois que você conhece X:
A partir dela define-se o ganho de informação, que é a redução de incerteza obtida ao usar uma variável explicativa:

É exatamente esse o critério usado pelos algoritmos ID3 e C4.5 para escolher em qual variável dividir cada nó de uma árvore de decisão. A cada divisão, o algoritmo seleciona a variável com maior ganho de informação, ou seja, a que mais reduz a incerteza sobre a classe alvo.
Entropia versus impureza de Gini
| Critério | Fórmula | Máximo com 2 classes |
|---|---|---|
| Entropia | − Σ pi log2 pi | 1,0 |
| Impureza de Gini | 1 − Σ pi2 | 0,5 |
Pegadinha clássica: a impureza de Gini das árvores de decisão não é o índice de Gini de concentração de renda. São medidas diferentes, com fórmulas diferentes, que apenas compartilham o nome do mesmo autor. Se a questão fala em desigualdade e curva de Lorenz, é o de concentração. Se fala em nó, divisão ou classificação, é o de impureza.
Onde a entropia aparece na prática
- Árvores de decisão: critério de divisão dos nós via ganho de informação
- Redes neurais: a função de perda cross-entropy deriva diretamente desse conceito
- Compressão de dados: a entropia é o limite teórico mínimo de bits por símbolo
- Seleção de variáveis: informação mútua para escolher preditores relevantes
- Ecologia e demografia: índice de diversidade de Shannon
- Inferência bayesiana: princípio da máxima entropia para escolher prioris pouco informativas
O conceito foi formalizado por Claude Shannon em 1948, no artigo A Mathematical Theory of Communication, texto fundador da teoria da informação.
Erros mais comuns na hora da prova
- Confundir entropia com variância. A variância mede dispersão em torno da média e exige variável numérica. A entropia mede incerteza e funciona também com variável qualitativa, porque só usa probabilidades.
- Achar que valores altos da variável elevam a entropia. Não elevam. Multiplicar todos os valores por mil não muda nada.
- Errar a base do logaritmo. Responder em nats quando a questão pede bits derruba a alternativa.
- Esquecer o sinal negativo e chegar a uma entropia negativa, o que é impossível no caso discreto.
- Tratar 0 · log 0 como indefinido em vez de aplicar a convenção de que vale zero.
Questões comentadas
Questão 1 (Cebraspe, ABIN)
Considere que a variável aleatória X possa assumir n valores diferentes com probabilidades p1, p2, …, pn, respectivamente, em que n ≥ 2. A respeito das expressões das entropias de ordem q de Shannon e de Rényi associadas a X, e sabendo que ambas utilizam o logaritmo neperiano, julgue o item a seguir.
Se todas as probabilidades pi (i = 1, …, n) forem iguais, então a entropia de Shannon e a entropia de Rényi serão iguais a ln(n), para qualquer valor de q.
Ver gabarito comentado
Gabarito: CERTO.
Passo 1. Entropia de Shannon na uniforme. Substituindo pi = 1/n para todo i:
Passo 2. Somatório da entropia de Rényi. Cada termo elevado a q vale n−q, e são n termos iguais:
Passo 3. Substituição na fórmula de Rényi.
O fator (1 − q) cancela e o resultado independe de q. Para q = 1, a entropia de Rényi é definida pelo limite, que converge exatamente para a de Shannon, também ln n. Item certo.
A armadilha: o candidato tenta testar valores de q em vez de fazer o cancelamento algébrico e perde tempo. Repare também que a banca avisou sobre o logaritmo neperiano, então a resposta sai em nats, não em bits. A distribuição uniforme é o único caso em que todas as entropias de Rényi coincidem.
Questão 2 (IADES)
H(X) [entropia de Shannon] pode ser vista como uma medida da quantidade média de informação contida em X ou, de forma equivalente, a quantidade de incerteza que existe até o valor de X ser revelado.
BLOCH, M.; BARROS, J. Physical-layer security: from information theory to security engineering. Cambridge: Cambridge University Press, 2011. Tradução livre.
Acerca da entropia de Shannon, e sendo X uma variável discreta aleatória, assinale a alternativa correta.
a) H(X) pode ter valores positivos e negativos. Quanto maior o valor de H(X), menos incerteza existe no sistema.
b) H(X) pode ter qualquer valor positivo, não tendo valor limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), menos incerteza existe no sistema.
c) H(X) tem um valor positivo e limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), menos incerteza existe no sistema.
d) H(X) pode ter qualquer valor positivo, não tendo valor limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), mais incerteza existe no sistema.
e) H(X) tem um valor positivo e limitado pelo número de valores distintos de X. Quanto maior o valor de H(X), mais incerteza existe no sistema.
Ver gabarito comentado
Gabarito: letra E.
A questão testa duas propriedades ao mesmo tempo. Analise cada uma separadamente e as alternativas caem sozinhas.
Propriedade 1: a entropia é não negativa e tem teto. Como toda probabilidade fica entre 0 e 1, a fórmula sempre devolve valor maior ou igual a zero. E o valor máximo depende justamente da quantidade de resultados possíveis:
Ou seja, H(X) é limitada pelo número de valores distintos de X. Isso elimina de imediato as alternativas B e D, que negam a existência de limite.
Propriedade 2: mais entropia significa mais incerteza. A entropia mede imprevisibilidade. Quando um resultado é certo, a entropia é zero. Quando todos são equiprováveis, ela atinge o máximo. Portanto, valor alto de H(X) indica mais incerteza, não menos. Isso derruba as alternativas A e C.
Resta a letra E, que acerta as duas propriedades. A alternativa A ainda erra duas vezes, porque também afirma que a entropia pode ser negativa, o que é impossível no caso discreto.
A armadilha: a banca combinou duas propriedades independentes nas cinco alternativas para punir quem sabe só metade do conteúdo. Um rigor a mais: a entropia é, na verdade, não negativa, podendo valer exatamente zero quando um resultado tem probabilidade 1. A banca escreveu “valor positivo” em sentido amplo, e nenhuma alternativa explora esse detalhe, então ele não muda o gabarito.
Você entende a teoria, mas trava na hora de resolver a questão?
Isso acontece com quase todo candidato, e não é falta de inteligência. É método. No curso Estatística para Concurso você aprende a reconhecer o que a banca está cobrando e resolver com segurança, do conceito básico até os temas avançados que aparecem nos editais de Ciência de Dados.
Perguntas frequentes
Entropia pode ser negativa?
Não, no caso discreto. Como toda probabilidade está entre 0 e 1, o logaritmo é negativo e o sinal da fórmula inverte esse resultado. Em variáveis contínuas, a entropia diferencial pode assumir valores negativos, mas isso raramente é cobrado em concurso.
Qual a diferença entre entropia e variância?
A variância mede o quanto os valores se afastam da média e exige variável numérica. A entropia mede incerteza usando apenas as probabilidades, então funciona também para variáveis qualitativas, como cor, região ou categoria de resposta.
Qual distribuição tem entropia máxima?
No caso discreto com n resultados, a uniforme, com H = log2 n. Entre distribuições contínuas com média e variância fixadas, a normal é a de máxima entropia. Já no suporte positivo com média fixada, a exponencial ocupa esse papel.
O que é entropia de Rényi e por que ela cai em prova?
É uma generalização da entropia de Shannon, controlada por um parâmetro q que ajusta o peso dado a eventos raros ou frequentes. Shannon é o caso limite quando q tende a 1. Cai em provas de inteligência e ciência de dados, como já ocorreu na ABIN.
Preciso decorar valores de logaritmo para a prova?
Poucos. Vale memorizar log2 0,5 = −1, log2 0,25 = −2, log2 0,125 = −3, log2 2 = 1, log2 4 = 2 e log2 8 = 3. A maioria das questões usa probabilidades que são potências de 2 justamente para permitir cálculo sem calculadora.
Entropia cai em concurso de estatística ou só de TI?
Cai nos dois. Em provas de TI e Ciência de Dados aparece ligada a árvores de decisão e aprendizado de máquina. Em provas de Estatística surge em teoria da informação, medidas de diversidade e no princípio da máxima entropia. Editais recentes com ênfase em Ciência de Dados aumentaram bastante a frequência do tema.
Checklist de revisão
- Fórmula de Shannon: H(X) = − Σ P(xi) logb P(xi)
- Unidade padrão: bits, com base 2. Com ln, a resposta sai em nats
- Entropia mínima: zero, quando há certeza
- Entropia máxima: log2 n, na distribuição uniforme
- Depende só das probabilidades, nunca dos valores
- Rényi na uniforme: ln n para qualquer q
- Ganho de informação: IG = H(Y) − H(Y|X)
- Impureza de Gini das árvores é diferente do Gini de concentração
Continue estudando
- Distribuição Uniforme, a de entropia máxima no caso discreto
- Teorema de Bayes, base da atualização de incerteza
- Probabilidade de Laplace, o caso equiprovável
- Índice de Gini, para não confundir com a impureza de Gini
- Glossário completo de Estatística
Se este conteúdo te ajudou, compartilhe com quem também está estudando para concurso e deixe sua dúvida nos comentários.






Deixe um comentário