Aroeira: Massivo Corpus em português para treinar modelos de linguagem
Recentemente, há um interesse crescente para desenvolvimento de modelos de linguagem, entretanto a disponibilidade de dados é predominante…
Aroeira: Massivo Corpus em português para treinar modelos de linguagem
Recentemente, há um interesse crescente para desenvolvimento de modelos de linguagem, entretanto a disponibilidade de dados é predominante em inglês, o que limita iniciativas para desenvolvimento de modelos de linguagem em português. É nesse contexto que o Aroeira se destaca como movimento pioneiro para fomentar o ecossistema de IA e modelagem em português. Construído pelo Instituto de Ciência e Tecnologia do Itaú (ICTi), Aroeira é um corpus (coleção de dados de texto) de grande escala com objetivo de suprir insumos altamente curados para modelos no idioma.
Como o Aroeira foi construído?
O Aroeira é uma grande coleção de dados textuais, lançado em 2024, com foco em treinamento de modelos de linguagem na língua portuguesa. O banco de dados conta com cerca de 35 milhões de documentos e 15 bilhões de tokens, totalizando em torno de 100 GB de dados apenas em português. Essa volumetria de dados é muito robusta para treinamento de modelos PLN.
Os dados foram obtidos através do framework do Common Crawl, ferramenta de webscrapping de diversos sites e endereços digitais. Apesar do grande volume de dados, o time desenvolvedor tinha uma grande preocupação quanto à qualidade de dados, tanto em termos de fluidez da língua, bem como exclusão de conteúdo potencialmente nocivo. Todo o pipeline de qualidade pode ser dividido em:
- Pipeline de Dados
a. Coleta de dados Warc do Common Crawl.
b. Extração dos textos dos Warcs.
c. Identificação do idioma, removendo textos de outras línguas.
d. Exclusão de duplicatas e documentos de HTML
e. Filtros de qualidade e fluência de escrita, como: quantidade de palavras distintas, significativas e diversas.
- Pipeline de Segurança de Conteúdo
a. Filtragem de pornografia.
b. Filtragem de conteúdo potencialmente tóxico.
c. Retirada de dados que reforçam estereótipos ou preconceitos (regional, religioso, racial, sexual e entre outros).
d. Categorização dos documentos.
Todo esse rigoroso pipeline foi essencial para obtenção de um dataset altamente curado e com insumo de grande qualidade para os modelos.
Métricas da base de dados
Segundo o mapeamento feito pelo grupo de pesquisa para o artigo do Aroeira, segue uma tabela comparativa entre principais corpus para língua portuguesa:

O Aroeira é um dataset com um volume muito relevante para treinar modelos de linguagem comparado a outros corpus da literatura. Além disso, Aroeira é um corpus bem atualizado, com cerca de 20% de seus dados oriundos de 2023 e com alta variedade de tokens (mais de 15 bilhões de tokens).
Como posso utilizar o Aroeira para treinar o modelo?
O Aroeira está público no link aqui, sobre a licença Creative Commons CC-BY-NC 4.0, permitindo seu uso para fins não comerciais. Assim, desejamos que o Aroeira seja de grande aplicação para pesquisadores e estudantes para desenvolvimentos de diversas iniciativas em IA na língua portuguesa.
Qualquer pessoa que deseja trabalhar com corpus Aroeira pode fazer o download através do pacote datasets fornecido pela Hugging Face:
from datasets import load_dataset
dataset = load_dataset(“Itau-Unibanco/aroeira”)
O Aroeira está em formato Parquet, o que facilita seu uso em outras ferramentas em Python.
Trabalhos Acadêmicos
O Aroeira serviu como insumos para o trabalho escrito e apresentado na 34 Conferência Brasileira de Sistemas Inteligentes (BRACIS) em 2024, na cidade de Belém-PA que pode ser citado como:
Lira, T. et al. (2025). Aroeira: A Curated Corpus for the Portuguese Language with a Large Number of Tokens. In: Paes, A., Verri, F.A.N. (eds) Intelligent Systems. BRACIS 2024. Lecture Notes in Computer Science(), vol 15412. Springer, Cham. https://doi.org/10.1007/978-3-031-79029-4_13
Conclusão
O corpus Aroeira é um corpus de grande porte e altamente curado que visa suprir as restrições de disponibilidade de dados para língua portuguesa. Sua publicação objetiva fomentar o ecossistema de pesquisa e desenvolvimento de modelos PLN para português com modelos de linguagens mais complexos e precisos, bem como permitir que qualquer pessoa use o corpus para fins não comerciais.
**Lucas Orosco** é Phd em Engenharia da Computação sobre geração de texto para aplicações de aumento de dados e mestre em Engenharia de Sistemas pela Escola Politécnica da USP, Orosco tem experiência nas áreas de otimização, CRM, clustering, análise de texto e anomalias. No Instituto de Ciência e Tecnologia Itaú, atua como coordenador em Ciência de Dados com foco em processamento de linguagem natural (PLN) e IA Generativa.
메타데이터
- post_id
- 35b2b52c82c0
- slug
- aroeira-massivo-corpus-em-português-para-treinar-modelos-de-linguagem-35b2b52c82c0
- url
- https://medium.com/@ictitau/aroeira-massivo-corpus-em-portugu%C3%AAs-para-treinar-modelos-de-linguagem-35b2b52c82c0
- canonical_url
- https://medium.com/@ictitau/aroeira-massivo-corpus-em-portugu%C3%AAs-para-treinar-modelos-de-linguagem-35b2b52c82c0
- author_url
- https://medium.com/@ictitau
- status
- ok
- fetched_at
- 2026-06-09 15:37:30