Files
clientflow_backend/RELEASE_v4926_3.md
2026-06-09 22:55:58 +01:00

36 lines
1.3 KiB
Markdown

# v4926.3 — Email identity model config and cleanup
## Objetivo
Melhorar a extração de identidade de emails antes do enriquecimento fiscal, com modelo LLM dedicado e limpeza determinística final.
## Alterações
- Novo `EMAIL_IDENTITY_LLM_MODEL` separado de `OPENROUTER_MODEL`.
- `scripts/batch_validate_email_identity.py` aceita `--model` para comparar modelos sem alterar `.env`.
- O batch mostra o modelo usado no cabeçalho.
- Sanitização de `person_name`:
- remove artefactos Unicode/CJK como `Luis Roch游戏副本a`;
- rejeita rodapés tipo `Enviado do meu Galaxy`.
- Sanitização de `company_mentions`:
- remove frases longas de avisos legais/GDPR;
- extrai nomes curtos como `SOPAC, S.A` e `Imoprates, Lda`;
- rejeita mentions com palavras de ruído legal.
- `confidence` fica limitada quando não há empresa extraída, para não parecer evidência fiscal forte.
- O resultado guarda `llm_model` no payload quando usa LLM.
## Uso recomendado
```bash
EMAIL_IDENTITY_LLM_MODEL="anthropic/claude-sonnet-4"
```
Ou teste isolado:
```bash
PYTHONPATH=. python scripts/batch_validate_email_identity.py \
--limit 20 \
--use-llm \
--timeout-seconds 30 \
--model "anthropic/claude-sonnet-4"
```
## Nota operacional
A extração continua a ser evidência para revisão/enriquecimento. Não deve auto-aplicar cliente fiscal sozinha.