A vantagem do modelo sobre a régua é real — o tamanho do erro é do problema, não dele
A previsão está no ar desde 28/08/2026 e a pergunta natural chegou rápido:
o erro que /acuracia mostra está dentro do esperado, ou o modelo é
irrelevante — não bate a régua de verdade —, ou ainda é cedo demais
para dizer qualquer coisa? As três hipóteses têm respostas diferentes, e
esta nota junta o que já dá para responder com o que ainda não dá.
Método
Três fontes de evidência, de naturezas diferentes, precisam ser separadas para não misturar “o método funciona” com “a operação já provou que funciona”:
- O backtest anual (
nameplate-ml/docs/modelo-v1.md): walk-forward mensal sobre 2024, 2025 e 2026 inteiros — o modelo treina só no passado e prevê o mês seguinte, nunca vendo o dia que está avaliando. Milhares de meias-horas por ano. - O mini-backtest de 30 dias, embutido em cada
previsao.json(mae_30d_mwemae_30d_regua_mw): o mesmo princípio — treina até 30 dias atrás, ancora em cada dia da janela e prevê recursivamente, como a operação prevê de verdade — mas na janela mais recente, a que interessa agora. - O histórico real (
historico-acuracia.json, publicado em/acuracia): o que o modelo disse ontem contra o que o ONS registrou depois — não é backtest, é a operação de fato acontecendo.
Para separar “erro grande” de “problema difícil”, a volatilidade do corte
em agosto/2026 foi medida na própria série (serie-sistema.parquet):
média e desvio-padrão do corte_mw no mês.
Resultados
1. A vantagem sobre a régua é consistente em três anos, não um acidente de uma janela. O confronto anual mostra o modelo (v1 + correção) batendo a persistência todo ano, com a mesma ordem de grandeza:
| Ano | Régua (MAE) | Modelo (MAE) | Vantagem |
|---|---|---|---|
| 2024 | 1.019 MW | 852 MW | ~16% |
| 2025 | 1.953 MW | 1.746 MW | ~11% |
| 2026 (ano todo) | 2.186 MW | 1.852 MW | ~15% |
2. Nos últimos 30 dias a vantagem relativa cresceu, não encolheu.
mae_30d_mw × mae_30d_regua_mw em 31/08/2026:
| Horizonte | Régua | Modelo | Vantagem |
|---|---|---|---|
| d1 (24h) | 3.366 MW | 2.540 MW | 25% |
| d2 (48h) | 4.432 MW | 3.339 MW | 25% |
| d3 (72h) | 5.056 MW | 3.389 MW | 33% |
3. O erro absoluto subiu porque o alvo ficou muito mais barulhento, não porque o modelo piorou. Em agosto/2026 o corte médio do sistema foi de 8.170 MW com desvio-padrão de 7.606 MW — quase do tamanho da própria média. O dia 28/08 teve corte médio de 3.279 MW; o dia seguinte, 29/08, pulou para 7.846 MW — mais que dobrou de um dia para o outro. Até a régua, que copia o dia anterior, erra 3,4–5,1 GW nesse regime; o modelo erra 25–33% menos que isso, mas continua sendo um erro grande em MW porque o problema em si está mais difícil agora.
4. O viés é neutro em d1 e negativo em d2/d3. vies_30d_mw: 0 MW em
d1, −508 MW em d2, −465 MW em d3 — o modelo está subestimando dois e
três dias à frente nesta janela. Uma hipótese: o fator de correção de
nível (calibrado nos últimos 30 dias) ainda está digerindo o salto de
agosto e não alcançou o patamar novo.
5. Os dois únicos dias reais já confirmam o padrão de volatilidade, não
o contradizem. historico-acuracia.json tem duas linhas: em 28/08 (dia
manso) a régua venceu; em 29/08 (o dia que dobrou) o modelo venceu por
uma margem grande. Amostra pequena demais para conclusão própria, mas
consistente com o que o backtest já previa sobre dias de salto.
Conclusões
- O modelo não é irrelevante. A vantagem sobre a persistência apareceu em três anos diferentes, com metodologias de medição diferentes, sempre fora da amostra — isso é edge estrutural, não ruído de uma medição.
- O tamanho do erro em MW não é o número certo para julgar “é bom?” — o certo é a vantagem relativa sobre a régua, porque os dois competem no mesmo alvo barulhento. Em números absolutos, agosto/2026 é o mês mais difícil da série até aqui.
- O viés negativo em d2/d3 é o ponto a vigiar, não a acurácia média: se persistir depois que agosto passar, é sinal de que a correção de nível precisa reagir mais rápido a mudanças de regime.
- A promessa certa para o produto continua sendo incerteza declarada,
não precisão — e é isso que
mae_30d_mw,vies_30d_mwecobertura_80_pctfazem, publicados a cada rodada.
O que ainda não sabemos
Se a vantagem de 25–33% desta janela é o novo normal ou um efeito de
agosto ser um mês difícil também para a régua (o que infla a vantagem
relativa do modelo sem ele ter ficado “melhor” em termos absolutos).
Responder exige olhar o mesmo confronto num mês mais calmo — a série de
mae_30d_mw/mae_30d_regua_mw publicada a cada rodada já está
acumulando o material para isso.
E, mais importante: o histórico real ainda é jovem demais para falar
sozinho — dois dias não provam nada por si, só ilustram o que o backtest
já dizia. Esta nota ganha uma sucessora quando historico-acuracia.json
acumular semanas de dias fechados e a curva previsto × realizado puder
ser julgada com a própria força, sem precisar do backtest para embasar.