O registro contra o qual o selo é medido.
Toda afirmação de acurácia deste site leva a uma entrada aqui: o que foi previsto, contra qual resultado real, com que método — e o que errou. As entradas são datadas e só mudam por medição.
A régua em produção: 16,73 pp, ainda não verde.
O questionário completo de uma pesquisa brasileira publicada de consumo e opinião (fevereiro de 2026, N=1.557, painel online) foi aplicado a uma população sintética calibrada no Censo 2022. O resultado é a régua que o produto lê hoje — e ela fica acima do limiar do selo Calibrado.
| O que foi medido | |
|---|---|
| Desenho | Open-book, declarado como tal. Os resultados reais já estavam no repositório antes da rodada; o prompt de sessão não contém nenhum deles, e a população foi calibrada no Censo, nunca na pesquisa. Leia como validação de calibração, não como predição cega. |
| População | Um lote de 2.401 indivíduos sintéticos calibrado no Censo 2022, filtrado a adultos conectados 18+ para casar com a base da pesquisa. 200 respondentes por pergunta. |
| Instrumento | 116 itens em quatro blocos (compra sazonal, hábitos alimentares, longevidade, segurança), verbatim; 120 comparáveis após expandir grades de múltipla escolha; um item excluído por não ter par no resultado real. |
| Erro agregado | MAE de 16,73 pontos percentuais nas 120 perguntas. O selo Calibrado exige menos de 15 — então o selo desta população segue Direcional. |
| Calibração | Platt leave-one-block-out: ajusta em três dos quatro blocos, valida no quarto, rotacionando, de modo que cada pergunta recebe um valor calibrado fora da amostra de ajuste. |
| Cobertura das bandas (alvo 90%, held-out) | Binária 0,909 · ordinal 0,961 · share 0,987 após calibração. Meia-largura da banda: 22,07 pp. |
| Onde vive | Um artefato JSON versionado, embarcado com o motor. O Observatório o lê para dar nota a uma predição; uma versão de motor que não case mais com a régua rebaixa a nota para C automaticamente. |
Reproduzível offline a partir da rodada arquivada: zero chamadas de modelo, um script determinístico.
Onde a régua vale — e onde não vale.
O agregado esconde os recortes. Erro por segmento contra a mesma pesquisa, com leitura declarada: ok até 1,15× o agregado (19,24 pp), atenção até 1,35× (22,59 pp), restrito acima disso, e insuficiente sempre que a célula tem menos de 20 respondentes sintéticos — ali só o ruído amostral já é de uns 11 pp.
| Recorte | MAE (pp) | Leitura |
|---|---|---|
| Classe AB · Classe C · Gen X · Gen Z · Millennials · Sudeste · Sul · Homens · Mulheres | ≤ 19,24 | ok |
| Nordeste | 19,34 | atenção |
| Classe DE | 20,79 | atenção |
| Boomers | 23,16 | restrito |
| Centro-Oeste · Norte | n = 16 | insuficiente |
Cada número é a diferença entre duas estimativas. Só o lado sintético tem tamanho de amostra conhecido por célula; o lado real não publicou o n por célula, então o percentual humano é tratado como exato — limitação declarada, não rodapé.
Bateria adversarial: taxas publicadas.
Entrevistas hostis roteirizadas, rodadas como backtest. Oito sondas, uma por família de falha do registro de limitações, cada uma produzindo uma taxa gravada no ledger de calibração com a mesma disciplina da régua acima.
Aceitar o sem-sentido
Entrada sem sentido em três braços — palavras reais sem relação, palavra inventada, tema coerente mas fora de contexto. Aprova só quem estranha nos três. Medido no modelo de produção, n=100: 38 de 100 falharam sem proteção; 13 de 100 com a cláusula de sanidade. Cláusula é instrução, não portão: reduz, não elimina.
Anacronismo de corte de treino
Fato posterior ao corte do modelo, não injetado, tem de render um "não sei" honesto. Depois de publicar a regra de horizonte temporal no prompt, n=100: aprovação decidível 6,7% → 87,0%, com vereditos inconclusivos caindo de 127 para 2. Custo declarado: a sonda de pressão reversa foi de 94,0% para 86,7%.
O que as outras seis testam
Fato falso induzido (aderir a um nome ausente do contexto) · pressão reversa (deslocar posição sob apelo nu à maioria) · vácuo de conhecimento (responder sem contexto injetado) · consistência com a ficha (re-elicitar três dimensões da ficha no meio do diálogo, tolerância ±2) · painel sensível (primeira vs. terceira pessoa no mesmo construto) · ancoragem (mesma pergunta, âncora baixa vs. alta). Duas métricas de produto carregam a própria definição operacional dentro do artefato: distinguibilidade adversarial e taxa de aquiescência.
O bloco cego: registrado, ainda não rodado.
Um bloco da mesma pesquisa (atitudes sobre envelhecimento, cinco perguntas-chave em seis segmentos geração × classe) foi pré-registrado como predição cega: o commit da predição veio antes de qualquer número real ser aberto, e o histórico git prova a ordem. O motor ainda não rodou contra ele; o que existe é o baseline humano.
| Pergunta | Previsto às cegas (humano) | Real | Veredicto |
|---|---|---|---|
| Já se organiza para a velhice | AB > C > DE | AB 78 · C 64 · DE 60 | acerto forte |
| Preparo financeiro | gradiente de classe | AB 83 · C 67 · DE 58 | acerto forte |
| Emoção negativa | C/DE e mulheres no topo; 50+ tranquilo | C 62 > AB 53 · mulheres 61 · 50+ 54 | parcial |
| Preocupação com envelhecer | sobe com idade e restrição | cai com a idade (18–29: 45 · 50+: 31); AB no topo | erro |
| Receio de ficar sem dinheiro | inverso à classe (DE no topo) | quase universal, ~75%; DE levemente menor | erro |
Critério de aprovação do motor, fixado antes: Spearman ρ ≥ 0,6 em pelo menos 3 das 5 perguntas, gradiente de classe certo nos dois itens de preparo, MAE abaixo de 15 pp no total — e, como bônus discriminante, acertar que preocupação e receio não seguem vulnerabilidade financeira, onde a intuição errou. Viés de amostra declarado: painel online, 47% com ensino superior, 41% classe AB — "Brasil conectado", não o Censo.
Como ler este registro.
Selo só fica verde com backtest contra resultado real reportado — nunca por prompt. Tabelas por segmento são publicadas em toda rodada, nunca só o agregado. Desenho open-book é rotulado open-book. E quando um portão reprova, o prompt não é ajustado até passar: no máximo quatro ciclos documentados, cada um com a hipótese escrita antes da nova rodada.
Receba cada backtest novo por e-mail.
Quando uma população ganha ou perde um selo, ou um resultado real novo é medido contra o motor, escrevemos uma vez. Sem cadência de newsletter — só entradas novas no registro.