← Back to list

Aroeira: Massivo Corpus em português para treinar modelos de linguagem

Recentemente, há um interesse crescente para desenvolvimento de modelos de linguagem, entretanto a disponibilidade de dados é predominante…

Instituto de Ciência e Tecnologia Itaú · 2025-06-23 14:42 · 107 claps · 2.9 min read
#corpus-intelligence #artificial-intelligence #dataset #machine-learning #responsible-ai
Open on Medium ↗
Wiki topics: ML · Machine Learning AI · AI · General EDU · Education & Learning

Aroeira: Massivo Corpus em português para treinar modelos de linguagem

Recentemente, há um interesse crescente para desenvolvimento de modelos de linguagem, entretanto a disponibilidade de dados é predominante em inglês, o que limita iniciativas para desenvolvimento de modelos de linguagem em português. É nesse contexto que o Aroeira se destaca como movimento pioneiro para fomentar o ecossistema de IA e modelagem em português. Construído pelo Instituto de Ciência e Tecnologia do Itaú (ICTi), Aroeira é um corpus (coleção de dados de texto) de grande escala com objetivo de suprir insumos altamente curados para modelos no idioma.

Como o Aroeira foi construído?

O Aroeira é uma grande coleção de dados textuais, lançado em 2024, com foco em treinamento de modelos de linguagem na língua portuguesa. O banco de dados conta com cerca de 35 milhões de documentos e 15 bilhões de tokens, totalizando em torno de 100 GB de dados apenas em português. Essa volumetria de dados é muito robusta para treinamento de modelos PLN.

Os dados foram obtidos através do framework do Common Crawl, ferramenta de webscrapping de diversos sites e endereços digitais. Apesar do grande volume de dados, o time desenvolvedor tinha uma grande preocupação quanto à qualidade de dados, tanto em termos de fluidez da língua, bem como exclusão de conteúdo potencialmente nocivo. Todo o pipeline de qualidade pode ser dividido em:

  1. Pipeline de Dados

a. Coleta de dados Warc do Common Crawl.

b. Extração dos textos dos Warcs.

c. Identificação do idioma, removendo textos de outras línguas.

d. Exclusão de duplicatas e documentos de HTML

e. Filtros de qualidade e fluência de escrita, como: quantidade de palavras distintas, significativas e diversas.

  1. Pipeline de Segurança de Conteúdo

a. Filtragem de pornografia.

b. Filtragem de conteúdo potencialmente tóxico.

c. Retirada de dados que reforçam estereótipos ou preconceitos (regional, religioso, racial, sexual e entre outros).

d. Categorização dos documentos.

Todo esse rigoroso pipeline foi essencial para obtenção de um dataset altamente curado e com insumo de grande qualidade para os modelos.

Métricas da base de dados

Segundo o mapeamento feito pelo grupo de pesquisa para o artigo do Aroeira, segue uma tabela comparativa entre principais corpus para língua portuguesa:

O Aroeira é um dataset com um volume muito relevante para treinar modelos de linguagem comparado a outros corpus da literatura. Além disso, Aroeira é um corpus bem atualizado, com cerca de 20% de seus dados oriundos de 2023 e com alta variedade de tokens (mais de 15 bilhões de tokens).

Como posso utilizar o Aroeira para treinar o modelo?

O Aroeira está público no link aqui, sobre a licença Creative Commons CC-BY-NC 4.0, permitindo seu uso para fins não comerciais. Assim, desejamos que o Aroeira seja de grande aplicação para pesquisadores e estudantes para desenvolvimentos de diversas iniciativas em IA na língua portuguesa.

Qualquer pessoa que deseja trabalhar com corpus Aroeira pode fazer o download através do pacote datasets fornecido pela Hugging Face:

from datasets import load_dataset

dataset = load_dataset(“Itau-Unibanco/aroeira”)

O Aroeira está em formato Parquet, o que facilita seu uso em outras ferramentas em Python.

Trabalhos Acadêmicos

O Aroeira serviu como insumos para o trabalho escrito e apresentado na 34 Conferência Brasileira de Sistemas Inteligentes (BRACIS) em 2024, na cidade de Belém-PA que pode ser citado como:

Lira, T. et al. (2025). Aroeira: A Curated Corpus for the Portuguese Language with a Large Number of Tokens. In: Paes, A., Verri, F.A.N. (eds) Intelligent Systems. BRACIS 2024. Lecture Notes in Computer Science(), vol 15412. Springer, Cham. https://doi.org/10.1007/978-3-031-79029-4_13

Conclusão

O corpus Aroeira é um corpus de grande porte e altamente curado que visa suprir as restrições de disponibilidade de dados para língua portuguesa. Sua publicação objetiva fomentar o ecossistema de pesquisa e desenvolvimento de modelos PLN para português com modelos de linguagens mais complexos e precisos, bem como permitir que qualquer pessoa use o corpus para fins não comerciais.

**Lucas Orosco** é Phd em Engenharia da Computação sobre geração de texto para aplicações de aumento de dados e mestre em Engenharia de Sistemas pela Escola Politécnica da USP, Orosco tem experiência nas áreas de otimização, CRM, clustering, análise de texto e anomalias. No Instituto de Ciência e Tecnologia Itaú, atua como coordenador em Ciência de Dados com foco em processamento de linguagem natural (PLN) e IA Generativa.


메타데이터
post_id
35b2b52c82c0
slug
aroeira-massivo-corpus-em-português-para-treinar-modelos-de-linguagem-35b2b52c82c0
url
https://medium.com/@ictitau/aroeira-massivo-corpus-em-portugu%C3%AAs-para-treinar-modelos-de-linguagem-35b2b52c82c0
canonical_url
https://medium.com/@ictitau/aroeira-massivo-corpus-em-portugu%C3%AAs-para-treinar-modelos-de-linguagem-35b2b52c82c0
author_url
https://medium.com/@ictitau
status
ok
fetched_at
2026-06-09 15:37:30