# v4926.3 — Email identity model config and cleanup ## Objetivo Melhorar a extração de identidade de emails antes do enriquecimento fiscal, com modelo LLM dedicado e limpeza determinística final. ## Alterações - Novo `EMAIL_IDENTITY_LLM_MODEL` separado de `OPENROUTER_MODEL`. - `scripts/batch_validate_email_identity.py` aceita `--model` para comparar modelos sem alterar `.env`. - O batch mostra o modelo usado no cabeçalho. - Sanitização de `person_name`: - remove artefactos Unicode/CJK como `Luis Roch游戏副本a`; - rejeita rodapés tipo `Enviado do meu Galaxy`. - Sanitização de `company_mentions`: - remove frases longas de avisos legais/GDPR; - extrai nomes curtos como `SOPAC, S.A` e `Imoprates, Lda`; - rejeita mentions com palavras de ruído legal. - `confidence` fica limitada quando não há empresa extraída, para não parecer evidência fiscal forte. - O resultado guarda `llm_model` no payload quando usa LLM. ## Uso recomendado ```bash EMAIL_IDENTITY_LLM_MODEL="anthropic/claude-sonnet-4" ``` Ou teste isolado: ```bash PYTHONPATH=. python scripts/batch_validate_email_identity.py \ --limit 20 \ --use-llm \ --timeout-seconds 30 \ --model "anthropic/claude-sonnet-4" ``` ## Nota operacional A extração continua a ser evidência para revisão/enriquecimento. Não deve auto-aplicar cliente fiscal sozinha.