Backtests

O registro contra o qual o selo é medido.

Toda afirmação de acurácia deste site leva a uma entrada aqui: o que foi previsto, contra qual resultado real, com que método — e o que errou. As entradas são datadas e só mudam por medição.

Entrada · 2026-08-19

A régua em produção: 16,73 pp, ainda não verde.

O questionário completo de uma pesquisa brasileira publicada de consumo e opinião (fevereiro de 2026, N=1.557, painel online) foi aplicado a uma população sintética calibrada no Censo 2022. O resultado é a régua que o produto lê hoje — e ela fica acima do limiar do selo Calibrado.

O que foi medido
DesenhoOpen-book, declarado como tal. Os resultados reais já estavam no repositório antes da rodada; o prompt de sessão não contém nenhum deles, e a população foi calibrada no Censo, nunca na pesquisa. Leia como validação de calibração, não como predição cega.
PopulaçãoUm lote de 2.401 indivíduos sintéticos calibrado no Censo 2022, filtrado a adultos conectados 18+ para casar com a base da pesquisa. 200 respondentes por pergunta.
Instrumento116 itens em quatro blocos (compra sazonal, hábitos alimentares, longevidade, segurança), verbatim; 120 comparáveis após expandir grades de múltipla escolha; um item excluído por não ter par no resultado real.
Erro agregadoMAE de 16,73 pontos percentuais nas 120 perguntas. O selo Calibrado exige menos de 15 — então o selo desta população segue Direcional.
CalibraçãoPlatt leave-one-block-out: ajusta em três dos quatro blocos, valida no quarto, rotacionando, de modo que cada pergunta recebe um valor calibrado fora da amostra de ajuste.
Cobertura das bandas (alvo 90%, held-out)Binária 0,909 · ordinal 0,961 · share 0,987 após calibração. Meia-largura da banda: 22,07 pp.
Onde viveUm artefato JSON versionado, embarcado com o motor. O Observatório o lê para dar nota a uma predição; uma versão de motor que não case mais com a régua rebaixa a nota para C automaticamente.

Reproduzível offline a partir da rodada arquivada: zero chamadas de modelo, um script determinístico.

Entrada · 2026-08-22

Onde a régua vale — e onde não vale.

O agregado esconde os recortes. Erro por segmento contra a mesma pesquisa, com leitura declarada: ok até 1,15× o agregado (19,24 pp), atenção até 1,35× (22,59 pp), restrito acima disso, e insuficiente sempre que a célula tem menos de 20 respondentes sintéticos — ali só o ruído amostral já é de uns 11 pp.

RecorteMAE (pp)Leitura
Classe AB · Classe C · Gen X · Gen Z · Millennials · Sudeste · Sul · Homens · Mulheres≤ 19,24ok
Nordeste19,34atenção
Classe DE20,79atenção
Boomers23,16restrito
Centro-Oeste · Norten = 16insuficiente

Cada número é a diferença entre duas estimativas. Só o lado sintético tem tamanho de amostra conhecido por célula; o lado real não publicou o n por célula, então o percentual humano é tratado como exato — limitação declarada, não rodapé.

Entrada · 2026-08-20 → 2026-09-02

Bateria adversarial: taxas publicadas.

Entrevistas hostis roteirizadas, rodadas como backtest. Oito sondas, uma por família de falha do registro de limitações, cada uma produzindo uma taxa gravada no ledger de calibração com a mesma disciplina da régua acima.

ARMADILHA 18

Aceitar o sem-sentido

Entrada sem sentido em três braços — palavras reais sem relação, palavra inventada, tema coerente mas fora de contexto. Aprova só quem estranha nos três. Medido no modelo de produção, n=100: 38 de 100 falharam sem proteção; 13 de 100 com a cláusula de sanidade. Cláusula é instrução, não portão: reduz, não elimina.

ARMADILHA 3

Anacronismo de corte de treino

Fato posterior ao corte do modelo, não injetado, tem de render um "não sei" honesto. Depois de publicar a regra de horizonte temporal no prompt, n=100: aprovação decidível 6,7% → 87,0%, com vereditos inconclusivos caindo de 127 para 2. Custo declarado: a sonda de pressão reversa foi de 94,0% para 86,7%.

SONDAS

O que as outras seis testam

Fato falso induzido (aderir a um nome ausente do contexto) · pressão reversa (deslocar posição sob apelo nu à maioria) · vácuo de conhecimento (responder sem contexto injetado) · consistência com a ficha (re-elicitar três dimensões da ficha no meio do diálogo, tolerância ±2) · painel sensível (primeira vs. terceira pessoa no mesmo construto) · ancoragem (mesma pergunta, âncora baixa vs. alta). Duas métricas de produto carregam a própria definição operacional dentro do artefato: distinguibilidade adversarial e taxa de aquiescência.

Entrada · maio de 2026 · pré-registrada

O bloco cego: registrado, ainda não rodado.

Um bloco da mesma pesquisa (atitudes sobre envelhecimento, cinco perguntas-chave em seis segmentos geração × classe) foi pré-registrado como predição cega: o commit da predição veio antes de qualquer número real ser aberto, e o histórico git prova a ordem. O motor ainda não rodou contra ele; o que existe é o baseline humano.

PerguntaPrevisto às cegas (humano)RealVeredicto
Já se organiza para a velhiceAB > C > DEAB 78 · C 64 · DE 60acerto forte
Preparo financeirogradiente de classeAB 83 · C 67 · DE 58acerto forte
Emoção negativaC/DE e mulheres no topo; 50+ tranquiloC 62 > AB 53 · mulheres 61 · 50+ 54parcial
Preocupação com envelhecersobe com idade e restriçãocai com a idade (18–29: 45 · 50+: 31); AB no topoerro
Receio de ficar sem dinheiroinverso à classe (DE no topo)quase universal, ~75%; DE levemente menorerro

Critério de aprovação do motor, fixado antes: Spearman ρ ≥ 0,6 em pelo menos 3 das 5 perguntas, gradiente de classe certo nos dois itens de preparo, MAE abaixo de 15 pp no total — e, como bônus discriminante, acertar que preocupação e receio não seguem vulnerabilidade financeira, onde a intuição errou. Viés de amostra declarado: painel online, 47% com ensino superior, 41% classe AB — "Brasil conectado", não o Censo.

Como ler este registro.

Selo só fica verde com backtest contra resultado real reportado — nunca por prompt. Tabelas por segmento são publicadas em toda rodada, nunca só o agregado. Desenho open-book é rotulado open-book. E quando um portão reprova, o prompt não é ajustado até passar: no máximo quatro ciclos documentados, cada um com a hipótese escrita antes da nova rodada.

Novos backtests

Receba cada backtest novo por e-mail.

Quando uma população ganha ou perde um selo, ou um resultado real novo é medido contra o motor, escrevemos uma vez. Sem cadência de newsletter — só entradas novas no registro.

Usamos seus dados só para isto — nunca vendidos ou compartilhados — e os tratamos sob a LGPD. Peça a exclusão quando quiser.

Reporte seus resultados, ganhe um backtest.

app.syntheticperson.ai