Projeção das 54 cadeiras em disputa a partir da pesquisa mais recente de cada estado, somada às 27 que não vão às urnas. Cada candidato é classificado pelo campo a que se alinhou: Lula, Bolsonaro ou não alinhado.Você pode trocar o campo de qualquer candidato, cravar quem ganha em qualquer estado e escolher quais institutos considerar. O mapa e o placar se refazem na hora, e você pode gerar uma imagem do seu cenário para compartilhar.
Isto é uma leitura das pesquisas de hoje, para abrir a discussão sobre o próximo Senado. Não é uma previsão do resultado de outubro.
Duas cadeiras por estado. Cada eleitor vota em dois nomes e os dois mais votados se elegem. São 54 cadeiras em 27 estados, e a conta olha para as duas de cada estado juntas, porque elas não se decidem uma independentemente da outra.
A segunda cadeira é quase sempre mais incerta que a primeira. O primeiro colocado costuma ter folga sobre todo mundo, e a segunda vaga fica no meio do pelotão. Hoje, 20 das 27 primeiras cadeiras estão em Alta, contra 4 das segundas.
Uma pesquisa por estado. A mais recente com campo encerrado nos 40 dias anteriores. Cada estado é lido por uma pesquisa só, sem média entre institutos. Desligue um instituto e o estado passa a usar a mais recente entre os que sobraram. Estado sem pesquisa na janela fica sem classificação.
Usamos só o que o instituto publicou. Não redistribuímos indecisos, não aplicamos modelo de eleitor provável, não corrigimos viés de casa e não combinamos institutos. Cada uma dessas operações melhoraria a projeção se a premissa por trás dela estivesse certa, e nenhuma delas pode ser verificada com o que os institutos divulgam. A conta fica dentro do que a pesquisa mede, e o que ela não alcança está listado em “O que esta conta não diz”.
Na tela, o número é o mesmo da pesquisa. Não convertemos nada. Isso importa porque as casas publicam em bases diferentes: umas dão a fatia de cada candidato no total de votos, e a lista soma 100; outras dão quantos de cada 100 entrevistados citaram o nome, e como cada eleitor cita dois, a lista soma 200. Cada estado diz qual é a sua base logo acima da lista. Sem olhar a base, 54% no Amazonas e 15% no Rio de Janeiro parecem apoios muito diferentes, e são respostas a perguntas diferentes.
Os níveis. Alta a partir de 95%. Média de 85% a 95%. Baixa de 75% a 85%. Abaixo de 75%, a cadeira fica Em aberto.
O campo de cada candidato é inferido por nós. Vem de um levantamento de apoios declarados e é o insumo editorial da conta. Troque a classificação se discordar. O resultado se refaz na hora e é exato: o alinhamento não entra na simulação, ele só decide de qual campo a chance de cada candidato é somada.
Uma pesquisa é uma amostra. Entrevistadas outras mil pessoas no mesmo dia, os percentuais sairiam um pouco diferentes, e em disputas apertadas a ordem de chegada mudaria.
Cada candidato entra pela fatia que recebeu dos votos disponíveis: o percentual publicado dividido pela base daquela pesquisa.
Quem não declarou voto é a massa restante da distribuição e nunca disputa cadeira. O sorteio ordena os seis candidatos entre si; os não declarados não estão nessa ordenação, não são redistribuídos entre os candidatos e não entram na contagem que produz o nível. O efeito deles é indireto: quanto maior essa fatia, menores as fatias dos candidatos e menores as distâncias entre eles, e como o desvio encolhe mais devagar que a distância, a confiança cai.
A pesquisa é o centro, não um ponto de partida qualquer. As versões alternativas se distribuem em torno dos números que o instituto publicou: versões parecidas com o resultado da pesquisa são comuns, versões distantes são raras. Quem define até onde é razoável ir é o tamanho da amostra.
qᵢ = percentual publicado de i ÷ base
Var(qᵢ) = qᵢ (1 − qᵢ) / n
Cov(qᵢ, qⱼ) = −qᵢ qⱼ / nqᵢ é a fatia dos votos disponíveis do candidato i, e n é o número de entrevistados. A variância mede quanto o número de cada candidato oscila de uma versão para outra: quanto maior a amostra, menor a oscilação. A covariância é negativa porque os votos são finitos — numa versão em que um candidato sobe, os outros tendem a descer.
Sorteamos um milhão de versões de uma normal multivariada com essas médias e essa covariância. Em cada uma, ordenamos os seis candidatos entre si, tomamos os dois primeiros e anotamos a dupla que se elegeu. Ao final temos, para cada dupla possível, a frequência com que os dois saíram juntos. Entram os seis primeiros colocados de cada pesquisa: em toda a base, o sétimo mais perto de disputar uma vaga está a pelo menos 1,3 margens de erro de distância.
f(c, c′) = fração dos sorteios em que c e c′ se elegeram juntos
P(o campo F fica com ao menos uma cadeira) = Σ f(c, c′) das duplas
com ao menos um candidato de F
P(o campo F leva as duas cadeiras) = Σ f(c, c′) das duplas
com os dois candidatos de FA confiança de uma cadeira é a primeira dessas somas. Quando as duas cadeiras do estado saem do mesmo campo, a segunda passa a medir a frequência com que aquele campo leva as duas. E é só nesse agrupamento que o campo aparece — por isso reclassificar um candidato muda o grupo em que cada dupla entra, com os mesmos valores, sem refazer sorteio nenhum.
Por que a conta é sobre o par e não sobre cada cadeira. As duas cadeiras de um estado não são independentes: um candidato que sai da primeira posição normalmente vai para a segunda. Medir cada colocação isoladamente e juntar os dois resultados pode produzir uma combinação improvável. No Rio de Janeiro, o campo Lula é o mais provável tanto na primeira colocação quanto na segunda, e ainda assim eleger dois do campo Lula acontece em apenas 0% dos sorteios — Benedita da Silva, Carlos Jordy e Marcelo Crivella se alternam entre as vagas, e o resultado mais provável, com 92%, é um do campo Bolsonaro e um do campo Lula. Sortear a ordem completa e contar o par preserva isso.
Todos os candidatos competem ao mesmo tempo. É isso que faz dois estados com a mesma distância entre 1º e 2º receberem níveis diferentes: num deles o terceiro colocado está longe; no outro há três nomes empatados logo abaixo e basta um subir.
Qual cadeira é a 1ª e qual é a 2ª segue a ordem da pesquisa, os dois primeiros colocados, e candidatos empatados têm o mesmo peso no sorteio. A confiança de cada uma vem da simulação. Em 24 dos 27 estados os dois critérios apontam os mesmos campos; em Piauí (1ª cadeira, 47%), Rio de Janeiro (2ª cadeira, 46%) e Rondônia (2ª cadeira, 44%) eles divergem: a chance do campo de quem ocupa a cadeira na projeção fica abaixo de 50%, indecisa por qualquer caminho.
As fórmulas acima descrevem a incerteza, não o resultado. Para a probabilidade de uma ordem de chegada entre seis candidatos que flutuam de forma correlacionada não existe expressão fechada: seria uma integral em várias dimensões sem solução analítica. Daí sortear em vez de calcular direto.
O resultado é reprodutível. Uma semente por estado, derivada do próprio estado. Mesma entrada, mesmo número, sempre. Com um milhão de sorteios, o erro de simulação fica abaixo de 0,05 ponto percentual. Publicamos os percentuais que entraram, o tamanho da amostra, a semente e a rotina.
Ela não prevê outubro. Cobre só o erro de amostragem: o quanto o número oscilaria se a mesma pesquisa fosse feita com outras pessoas no mesmo dia. Não cobre mudança de opinião até a eleição, viés de instituto, nem a diferença entre quem declara voto e quem comparece. Somados, esses costumam ser maiores que o erro de amostragem. Confiança alta quer dizer que a pesquisa separa os campos com folga, não que a cadeira esteja resolvida.
Parte das cadeiras está resolvida por composição, não por medição. São aquelas em que todos os nomes com chance real pertencem ao mesmo campo: em Mato Grosso do Sul os dois nomes com chance real são do campo Bolsonaro, e as duas cadeiras ficam com esse campo qualquer que seja o resultado. Elas chegam a Alta pelo desenho da disputa, sem que nenhuma pesquisa tenha precisado separar ninguém. A ficha do estado indica quando é o caso.
O nível não diz quanta gente já se decidiu. Ele compara os candidatos entre si dentro do voto que a pesquisa registrou, e quem não declarou voto fica fora da comparação. A fatia de não declarados aparece no detalhe de cada estado, e varia muito: de 5,0% em Pernambuco a 39,0% em Rondônia.
Cada estado é lido por um instituto só. Não combinamos casas, e a discordância entre elas não entra no nível de confiança. Ela existe e não é pequena: na base atual, a distância entre dois candidatos medida por casas diferentes varia em mediana 6,1 pontos e chega a 29,9 dentro do mesmo estado. É o limite mais consequente do método. A tabela de pesquisas do estado mostra o tamanho dessa divergência.
As 27 cadeiras que não vão às urnas entram pelo alinhamento de cada senador, levantado do mesmo modo que o dos candidatos: apoio declarado, com a evidência registrada nome a nome. A lista está no fim da página, e você pode trocar qualquer classificação ali. Três dos 27 ficam como não alinhados.
Os cortes são nossos. 95, 85 e 75 organizam a leitura; não saem do cálculo. Uma cadeira em 94% e outra em 96% recebem rótulos diferentes e não são coisas diferentes. A probabilidade cheia está no detalhe de cada estado.
Sobre empate técnico. Quando as barras de erro de dois candidatos se tocam, costuma-se declarar empate técnico. O critério é mais rígido do que parece: para a comparação estar errada, a pesquisa precisa errar nos dois candidatos ao mesmo tempo e em direções opostas. Exigir que as faixas não se toquem equivale a exigir de 97% a 99% de certeza, não os 95% que a matéria anuncia. Empate técnico quer dizer “não tenho certeza suficiente” — não que os dois estejam iguais.
O que não fazemos: média entre institutos, modelo de eleitor provável, correlação entre estados.
Metodologia completa, com as sementes e o código
As 27 cadeiras eleitas em 2022 não vão às urnas e entram no placar pelo alinhamento de cada senador. Troque se discordar.