← Back to list

Extração de Boletos: uma comparação prática entre GPT e AWS Textract

Antes de tudo, este texto não tem como objetivo dizer qual tecnologia é melhor ou pior. O que compartilho aqui são impressões práticas…

André Coelho in Inside PicPay · 2026-01-20 18:55 · 2 claps · 4.1 min read
#aws-textract #gpt #ocr #picpay #tech
Open on Medium ↗
Wiki topics: ☁️ · DevOps & Cloud 📰 · Journalism & News

Extração de Boletos: uma comparação prática entre GPT e AWS Textract

Antes de tudo, este texto não tem como objetivo dizer qual tecnologia é melhor ou pior. O que compartilho aqui são impressões práticas obtidas a partir do uso real dessas soluções em um cenário específico, com seus acertos e limitações.

Em sistemas de pagamento, especialmente aqueles que lidam com boletos bancários em PDF, é comum a necessidade de aplicar OCR para identificar informações essenciais que permitem concluir uma transação. Entre esses dados, um é crítico: a linha digitável do boleto, a representação numérica do código de barras. Sem a extração correta dessas informações, o pagamento simplesmente não acontece.

O que é OCR e por que ele é essencial nesse cenário

OCR, ou Optical Character Recognition, é a técnica usada para extrair texto a partir de imagens ou documentos escaneados. No contexto de boletos, isso significa transformar um PDF que, na prática, é apenas uma imagem, em texto estruturado que o sistema consegue interpretar.

O objetivo aqui é além de extrair todo o conteúdo do documento, identificar com precisão campos específicos que fazem parte do fluxo de pagamento.

Tecnologias avaliadas

Nesta análise, comparei duas abordagens diferentes para OCR.

A primeira usando o modelo multimodal GPT-4o, que combina visão computacional com compreensão de linguagem natural.

A segunda usando o serviço AWS Textract, um OCR especializado em extração de texto de documentos.

Metodologia dos testes

Os testes foram realizados com 18 boletos em PDF, provenientes de diferentes empresas e concessionárias. Todos os testes foram executados via scripts em Python.

O foco da análise foi restrito a identificação da linha digitável. Outros campos do boleto não foram considerados relevantes para este cenário.

Além da qualidade da extração, medi também o tempo médio necessário para processar cada documento.

OCR usando GPT

Para este teste usei o modelo GPT-4o, principalmente por ser um modelo multimodal com suporte nativo a visão, o que permite enviar a imagem do boleto diretamente e pedir a extração do texto no mesmo fluxo.

No caso do GPT, um script em Python foi criado com um prompt orientando o modelo a agir como um OCR, solicitando explicitamente a extração fiel do texto presente na imagem do boleto.

Resultados gerais: - 18 arquivos processados

  • Tempo total aproximado de 458 segundos
  • Tempo médio por arquivo de cerca de 25 segundos

Em termos de tokens, a média ficou em torno de: - 1180 tokens de entrada

  • 855 tokens de saída
  • 2035 tokens totais

Ao analisar arquivo por arquivo, foi possível observar que, quando o GPT realizava a extração, a linha digitável estava corretos. No entanto, alguns documentos falharam completamente, retornando pouquíssimo texto ou praticamente nada.

Outro ponto relevante é a grande variação no tempo de processamento entre os arquivos, o que dificulta previsibilidade em sistemas que exigem baixa latência.

Esses casos chamam atenção porque o tempo de execução foi muito baixo, indicando que o modelo possivelmente não conseguiu interpretar corretamente a imagem ou o layout do documento.

OCR usando AWS Textract

A utilização do Textract exige um pouco mais de trabalho inicial, principalmente na configuração de credenciais, permissões e políticas na AWS.

Após essa etapa, foi criado um script em Python responsável por enviar os arquivos através da API Detect Document Text e recebe o texto extraído.

**Resultados gerais

  • **18 arquivos processados
  • Tempo total de aproximadamente 83 segundos
  • Tempo médio por arquivo de cerca de 4,6 segundos

Em todos os arquivos, o texto foi extraído corretamente. O campo de interesse, linha digitável, estavam consistentes com o conteúdo original do PDF.

O gráfico abaixo mostra o tempo por arquivo, e dá para ver que a variação é bem menor do que no GPT, com os PDFs ficando em uma faixa bem mais estável.

Comparado ao GPT, o Textract apresentou um tempo de execução significativamente menor e uma consistência muito maior entre os documentos. Nesse conjunto de testes, o Textract ficou bem próximo da média, enquanto no GPT ele passou de 41s, reforçando a diferença de previsibilidade.

Custos

No caso do GPT, o custo está diretamente ligado ao uso de tokens. Considerando a média de aproximadamente 2000 tokens por documento, o custo pode variar bastante dependendo do modelo e da escala do sistema.

Já o Textract possui uma precificação mais previsível. No teste foi utilizada a API Detect Document Text, cujo custo, segundo a documentação oficial da AWS, é cobrado por volume de páginas processadas.

Até um milhão de páginas por mês, o valor é de USD 1,50 por mil páginas. Acima disso, o valor cai para USD 0,60 por mil páginas.

Conclusão

A partir dos resultados, fica claro que ambas as abordagens funcionam, mas atendem a necessidades diferentes.

O GPT mostrou que consegue realizar OCR e extrair corretamente os dados quando o processamento acontece como esperado. Além disso, ele traz a vantagem de entender contexto, o que pode ser útil em cenários mais complexos no futuro. No entanto, apresentou falhas em alguns documentos e um tempo de execução mais alto e instável.

O AWS Textract, por outro lado, se mostrou extremamente consistente e rápido para o objetivo proposto. Para um sistema de pagamento que exige previsibilidade, baixa latência e extração confiável de campos bem definidos, ele se encaixa de forma mais natural.

No fim, a escolha não é sobre qual tecnologia é melhor, mas sim sobre qual problema você está tentando resolver.

Referências

AWS Textract https://aws.amazon.com/pt/textract/

GPT-4o https://platform.openai.com/docs/models/gpt-4o

Pricing OpenAI https://platform.openai.com/docs/pricing


메타데이터
post_id
a94472dc96dc
slug
extração-de-boletos-uma-comparação-prática-entre-gpt-e-aws-textract-a94472dc96dc
url
https://medium.com/inside-picpay/extra%C3%A7%C3%A3o-de-boletos-uma-compara%C3%A7%C3%A3o-pr%C3%A1tica-entre-gpt-e-aws-textract-a94472dc96dc
canonical_url
https://medium.com/inside-picpay/extra%C3%A7%C3%A3o-de-boletos-uma-compara%C3%A7%C3%A3o-pr%C3%A1tica-entre-gpt-e-aws-textract-a94472dc96dc
author_url
https://medium.com/@andre.luiz1987
status
ok
fetched_at
2026-06-09 15:37:30