1.3 KiB
1.3 KiB
v4926.3 — Email identity model config and cleanup
Objetivo
Melhorar a extração de identidade de emails antes do enriquecimento fiscal, com modelo LLM dedicado e limpeza determinística final.
Alterações
- Novo
EMAIL_IDENTITY_LLM_MODELseparado deOPENROUTER_MODEL. scripts/batch_validate_email_identity.pyaceita--modelpara comparar modelos sem alterar.env.- O batch mostra o modelo usado no cabeçalho.
- Sanitização de
person_name:- remove artefactos Unicode/CJK como
Luis Roch游戏副本a; - rejeita rodapés tipo
Enviado do meu Galaxy.
- remove artefactos Unicode/CJK como
- Sanitização de
company_mentions:- remove frases longas de avisos legais/GDPR;
- extrai nomes curtos como
SOPAC, S.AeImoprates, Lda; - rejeita mentions com palavras de ruído legal.
confidencefica limitada quando não há empresa extraída, para não parecer evidência fiscal forte.- O resultado guarda
llm_modelno payload quando usa LLM.
Uso recomendado
EMAIL_IDENTITY_LLM_MODEL="anthropic/claude-sonnet-4"
Ou teste isolado:
PYTHONPATH=. python scripts/batch_validate_email_identity.py \
--limit 20 \
--use-llm \
--timeout-seconds 30 \
--model "anthropic/claude-sonnet-4"
Nota operacional
A extração continua a ser evidência para revisão/enriquecimento. Não deve auto-aplicar cliente fiscal sozinha.