Extração de Boletos: uma comparação prática entre GPT e AWS Textract
Antes de tudo, este texto não tem como objetivo dizer qual tecnologia é melhor ou pior. O que compartilho aqui são impressões práticas…
Extração de Boletos: uma comparação prática entre GPT e AWS Textract

Antes de tudo, este texto não tem como objetivo dizer qual tecnologia é melhor ou pior. O que compartilho aqui são impressões práticas obtidas a partir do uso real dessas soluções em um cenário específico, com seus acertos e limitações.
Em sistemas de pagamento, especialmente aqueles que lidam com boletos bancários em PDF, é comum a necessidade de aplicar OCR para identificar informações essenciais que permitem concluir uma transação. Entre esses dados, um é crítico: a linha digitável do boleto, a representação numérica do código de barras. Sem a extração correta dessas informações, o pagamento simplesmente não acontece.
O que é OCR e por que ele é essencial nesse cenário
OCR, ou Optical Character Recognition, é a técnica usada para extrair texto a partir de imagens ou documentos escaneados. No contexto de boletos, isso significa transformar um PDF que, na prática, é apenas uma imagem, em texto estruturado que o sistema consegue interpretar.
O objetivo aqui é além de extrair todo o conteúdo do documento, identificar com precisão campos específicos que fazem parte do fluxo de pagamento.
Tecnologias avaliadas
Nesta análise, comparei duas abordagens diferentes para OCR.
A primeira usando o modelo multimodal GPT-4o, que combina visão computacional com compreensão de linguagem natural.
A segunda usando o serviço AWS Textract, um OCR especializado em extração de texto de documentos.
Metodologia dos testes
Os testes foram realizados com 18 boletos em PDF, provenientes de diferentes empresas e concessionárias. Todos os testes foram executados via scripts em Python.
O foco da análise foi restrito a identificação da linha digitável. Outros campos do boleto não foram considerados relevantes para este cenário.
Além da qualidade da extração, medi também o tempo médio necessário para processar cada documento.
OCR usando GPT
Para este teste usei o modelo GPT-4o, principalmente por ser um modelo multimodal com suporte nativo a visão, o que permite enviar a imagem do boleto diretamente e pedir a extração do texto no mesmo fluxo.
No caso do GPT, um script em Python foi criado com um prompt orientando o modelo a agir como um OCR, solicitando explicitamente a extração fiel do texto presente na imagem do boleto.
Resultados gerais: - 18 arquivos processados
- Tempo total aproximado de 458 segundos
- Tempo médio por arquivo de cerca de 25 segundos
Em termos de tokens, a média ficou em torno de: - 1180 tokens de entrada
- 855 tokens de saída
- 2035 tokens totais
Ao analisar arquivo por arquivo, foi possível observar que, quando o GPT realizava a extração, a linha digitável estava corretos. No entanto, alguns documentos falharam completamente, retornando pouquíssimo texto ou praticamente nada.
Outro ponto relevante é a grande variação no tempo de processamento entre os arquivos, o que dificulta previsibilidade em sistemas que exigem baixa latência.

Esses casos chamam atenção porque o tempo de execução foi muito baixo, indicando que o modelo possivelmente não conseguiu interpretar corretamente a imagem ou o layout do documento.
OCR usando AWS Textract
A utilização do Textract exige um pouco mais de trabalho inicial, principalmente na configuração de credenciais, permissões e políticas na AWS.
Após essa etapa, foi criado um script em Python responsável por enviar os arquivos através da API Detect Document Text e recebe o texto extraído.
**Resultados gerais
- **18 arquivos processados
- Tempo total de aproximadamente 83 segundos
- Tempo médio por arquivo de cerca de 4,6 segundos
Em todos os arquivos, o texto foi extraído corretamente. O campo de interesse, linha digitável, estavam consistentes com o conteúdo original do PDF.
O gráfico abaixo mostra o tempo por arquivo, e dá para ver que a variação é bem menor do que no GPT, com os PDFs ficando em uma faixa bem mais estável.

Comparado ao GPT, o Textract apresentou um tempo de execução significativamente menor e uma consistência muito maior entre os documentos. Nesse conjunto de testes, o Textract ficou bem próximo da média, enquanto no GPT ele passou de 41s, reforçando a diferença de previsibilidade.

Custos
No caso do GPT, o custo está diretamente ligado ao uso de tokens. Considerando a média de aproximadamente 2000 tokens por documento, o custo pode variar bastante dependendo do modelo e da escala do sistema.
Já o Textract possui uma precificação mais previsível. No teste foi utilizada a API Detect Document Text, cujo custo, segundo a documentação oficial da AWS, é cobrado por volume de páginas processadas.
Até um milhão de páginas por mês, o valor é de USD 1,50 por mil páginas. Acima disso, o valor cai para USD 0,60 por mil páginas.
Conclusão
A partir dos resultados, fica claro que ambas as abordagens funcionam, mas atendem a necessidades diferentes.
O GPT mostrou que consegue realizar OCR e extrair corretamente os dados quando o processamento acontece como esperado. Além disso, ele traz a vantagem de entender contexto, o que pode ser útil em cenários mais complexos no futuro. No entanto, apresentou falhas em alguns documentos e um tempo de execução mais alto e instável.
O AWS Textract, por outro lado, se mostrou extremamente consistente e rápido para o objetivo proposto. Para um sistema de pagamento que exige previsibilidade, baixa latência e extração confiável de campos bem definidos, ele se encaixa de forma mais natural.
No fim, a escolha não é sobre qual tecnologia é melhor, mas sim sobre qual problema você está tentando resolver.
Referências
AWS Textract https://aws.amazon.com/pt/textract/
GPT-4o https://platform.openai.com/docs/models/gpt-4o
Pricing OpenAI https://platform.openai.com/docs/pricing
메타데이터
- post_id
- a94472dc96dc
- slug
- extração-de-boletos-uma-comparação-prática-entre-gpt-e-aws-textract-a94472dc96dc
- url
- https://medium.com/inside-picpay/extra%C3%A7%C3%A3o-de-boletos-uma-compara%C3%A7%C3%A3o-pr%C3%A1tica-entre-gpt-e-aws-textract-a94472dc96dc
- canonical_url
- https://medium.com/inside-picpay/extra%C3%A7%C3%A3o-de-boletos-uma-compara%C3%A7%C3%A3o-pr%C3%A1tica-entre-gpt-e-aws-textract-a94472dc96dc
- author_url
- https://medium.com/@andre.luiz1987
- status
- ok
- fetched_at
- 2026-06-09 15:37:30