Files
clientflow_backend/RELEASE_v4926_3.md
2026-06-09 22:55:58 +01:00

1.3 KiB

v4926.3 — Email identity model config and cleanup

Objetivo

Melhorar a extração de identidade de emails antes do enriquecimento fiscal, com modelo LLM dedicado e limpeza determinística final.

Alterações

  • Novo EMAIL_IDENTITY_LLM_MODEL separado de OPENROUTER_MODEL.
  • scripts/batch_validate_email_identity.py aceita --model para comparar modelos sem alterar .env.
  • O batch mostra o modelo usado no cabeçalho.
  • Sanitização de person_name:
    • remove artefactos Unicode/CJK como Luis Roch游戏副本a;
    • rejeita rodapés tipo Enviado do meu Galaxy.
  • Sanitização de company_mentions:
    • remove frases longas de avisos legais/GDPR;
    • extrai nomes curtos como SOPAC, S.A e Imoprates, Lda;
    • rejeita mentions com palavras de ruído legal.
  • confidence fica limitada quando não há empresa extraída, para não parecer evidência fiscal forte.
  • O resultado guarda llm_model no payload quando usa LLM.

Uso recomendado

EMAIL_IDENTITY_LLM_MODEL="anthropic/claude-sonnet-4"

Ou teste isolado:

PYTHONPATH=. python scripts/batch_validate_email_identity.py \
  --limit 20 \
  --use-llm \
  --timeout-seconds 30 \
  --model "anthropic/claude-sonnet-4"

Nota operacional

A extração continua a ser evidência para revisão/enriquecimento. Não deve auto-aplicar cliente fiscal sozinha.