A Aplicação de reduce_outliers() na Identificação de Incidentes de Segurança Aérea (2010–2020)
1. Introdução
A Aplicação de reduce_outliers() na Identificação de Incidentes de Segurança Aérea (2010–2020)

1. Introdução
Em modelagem de tópicos via BERTopic, o algoritmo HDBSCAN organiza os embeddings com base na densidade espacial, agrupando documentos que exibem alta concentração no espaço vetorial. Por definição, pontos que não formam núcleos densos o suficiente para satisfazer o critério *min_cluster_size* são automaticamente isolados e classificados como ruído (-1).
Esse processo, embora essencial para a robustez dos clusters principais, resulta na exclusão de narrativas que, embora possuam afinidade semântica, permanecem isoladas por não comporem um volume estatisticamente significativo de vizinhos próximos no espaço reduzido.
O método *reduce_outliers() do BERTopic *intervém precisamente nesse estágio, reavaliando esses documentos isolados e redistribuindo-os com base na similaridade vetorial direta aos centros dos tópicos estabelecidos.
Este trabalho investiga empiricamente a eficácia desse mecanismo por meio de um experimento comparativo em relatos de segurança aérea, utilizando o Tópico 6 como referência. O objetivo central é avaliar a capacidade do método de reatribuir narrativas com possível afinidade semântica previamente classificadas como ruído pelo critério de densidade, quantificando o impacto dessa reatribuição na estrutura temática e analisando a coerência semântica dos documentos reatribuídos.
1.1 Coleta e Tratamento de Dados
Este estudo baseia-se em um corpus composto por 4.031 narrativas textuais de incidentes operacionais, extraídas da base de dados do Aviation Safety Reporting System (ASRS Online). O recorte temporal abrange o período compreendido entre 2010 e 2020. Para garantir a especificidade da análise, aplicou-se um filtro rigoroso de seleção: foram consideradas apenas ocorrências registradas estritamente sob Condições Meteorológicas de Instrumentos (IMC). Este escopo ambiental foi definido para isolar relatos gerados sob restrições severas de visibilidade, teto baixo ou condições meteorológicas adversas, onde a operação visual (VMC) era inviável.
2.1 Modelo base sem reduce_outliers
Esse modelo foi configurado para equilibrar a preservação de estruturas locais e globais. No UMAP, utilizou-se *n_neighbors*=15 para capturar tanto relações locais quanto padrões globais, com *min_dist*=0.0 para favorecer a compactação dos embeddings.
No HDBSCAN, adotou-se *min_cluster_size*=30 para garantir a formação de agrupamentos estáveis. No pré-processamento, foram removidas stopwords e termos de anonimização (como “zzz”), frequentemente utilizados como marcadores de anonimização em narrativas aeronáuticas. Esses termos foram excluídos por não contribuírem semanticamente para a modelagem.


À esquerda, visualização do cluster correspondente ao Tópico 6. À direita, gráfico de barras com as principais palavras representativas de todos os tópicos do modelo.
[Quantitativo dos Tópicos Gerados pelo BERTopic]
Topic Count Topic
0 -1 1783 -1_missed approach_gps_vor_fms
1 0 308 0_severe_severe turbulence_route_moderate turb...
2 1 256 1_taxiway_taxi_braking_braking action
3 2 171 2_glideslope_glide_glide slope_slope
4 3 170 3_anti_anti ice_bleed_freezing
5 4 143 4_gpws_pull_egpws_terrain terrain
6 5 141 5_lbs_divert_minimum fuel_forecast
7 6 134 6_smoke_smell_odor_fumes
8 7 132 7_pitot_standby_ias_unreliable
9 8 126 8_oil_left engine_right engine_oil pressure
10 9 109 9_fms_fmc_route_transition
11 10 97 10_gps_garmin_compass_dg
12 11 76 11_pressurization_cabin altitude_masks_oxygen
13 12 76 12_hydraulic_landing gear_hyd_main
14 13 66 13_flap_slats_edge_trailing edge
15 14 63 14_tcas_ra_conflict_target
16 15 55 15_restriction_vnav_crossing_approaches
17 16 51 16_deice_fluid_deicing_type iv
18 17 43 17_windshear_shear_wind shear_knot
19 18 30 18_gso_gso approach_local_york
2.2 Análise do Tópico 6 no modelo base
No modelo base, o Tópico 6 emergiu como um cluster relativamente coeso, composto por 134 narrativas, o que equivale a 7,5% do total de 1.783 documentos classificados como ruído. O conteúdo está associado principalmente à presença de fumaça, odores anormais e gases na cabine.
A distribuição lexical do tópico indica forte centralidade em termos como smoke, smell, odor e fumes, além de vocabulário associado a procedimentos de cabine, como comunicação com comissários e uso de máscaras de oxigênio. Essa coesão semântica reflete a especificidade do tema, concentrando narrativas que descrevem eventos de degradação da qualidade do ar em voo.
Tópico 6
[('smoke', np.float64(0.06699680127226187)),
('smell', np.float64(0.04958806891298085)),
('odor', np.float64(0.03031479066869127)),
('fumes', np.float64(0.02191052320477073)),
('flight attendant', np.float64(0.02189450139810792)),
('attendant', np.float64(0.021870002861351708)),
('burning', np.float64(0.021432881903598804)),
('smelled', np.float64(0.017473397503309687)),
('flight attendants', np.float64(0.017318353633046027)),
('attendants', np.float64(0.017311048477690306))]
Em geral, os relatos apresentam estrutura temática homogênea. esse conjunto serviu como baseline para avaliar o impacto da redistribuição de outliers.
2.3 Identificação e análise do ruído associado ao Tópico 6
Do total de 1.783 documentos classificados como ruído pelo modelo base, isolou-se o subconjunto de relatos que compartilhavam o vocabulário temático do Tópico 6. Esse subconjunto, composto por 183 narrativas, representa 10,3% do volume total de dados inicialmente descartados. Para a realização dessa triagem, utilizou-se como filtro de busca a lista de palavras-chave características deste cluster, composta por termos como smoke, smell, odor, fumes e burning.
A aplicação do método TF-IDF, focada na relevância estatística desses termos dentro do conjunto de documentos classificados como ruído, permitiu a identificação de um subconjunto candidato por sobreposição lexical com o tema analisado.

A análise qualitativa revelou, contudo, que esse subconjunto abarcava uma diversidade lexical muito mais ampla, incluindo falhas mecânicas (ecam, vibration) e eventos meteorológicos (hail, microburst). Entre os termos de maior relevância identificados pelo TF-IDF aparecem palavras como tks, ecam, trim, vibration, hail e microburst, indicando a presença de falhas operacionais, danos estruturais e condições meteorológicas extremas. Esse cenário sugere que as narrativas compartilham menos características entre si quando comparados à forte coesão observada no Tópico 6.
2.3 Gerando o Segundo Modelo com reduce_outilers


À esquerda, visualização do cluster correspondente ao Tópico 6. À direita, gráfico de barras com as principais palavras representativas de todos os tópicos do modelo.
Após a aplicação do reduce_outliers(), o Tópico 6 expandiu-se de 134 para 170 narrativas. O rastreamento dos 183 registros filtrados via TF-IDF revelou um comportamento redistributivo preciso:
Migraram para o Tópico 6: 33 relatos.
Migraram para outros tópicos: 150 relatos.
Continuaram como ruído: 0 relatos.
A ausência de narrativas remanescentes como ruído evidencia que o método, ao desconsiderar a restrição de densidade local, força a realocação com base na similaridade de cosseno. Embora 100% das 183 narrativas selecionadas contivessem termos relacionados a fumaça e odores, critério da triagem inicial, 81,9% (150 de 183) apresentaram contextos semânticos distintos, sendo redistribuídas majoritariamente para os Tópicos 8 (17,5%), 0 (10,9%), 7 (8,7%) e 12 (8,2%). Esse resultado demonstra que a similaridade terminológica isolada é insuficiente para a classificação temática, confirmando que a similaridade vetorial atua como o filtro decisivo para a correta organização dos dados.
Sob essa ótica, a aplicação do método revelou uma diferença de cobertura no modelo original. Constatou-se que o Tópico 6 passou a incluir 33 narrativas adicionais após reatribuição baseada em similaridade vetorial, que haviam sido previamente classificadas como ruído pelo critério de densidade do HDBSCAN.
Portanto, o procedimento não apenas reduziu o conjunto de ruído analisado, mas também reorganizou documentos que haviam sido previamente excluídos da estrutura de clusters pelo critério de densidade do HDBSCAN, permitindo a incorporação de 33 narrativas adicionais ao Tópico 6. Esse incremento reflete um aumento de 24,6% em relação ao volume inicial do cluster (134 narrativas), atingindo um total de 170 após reatribuição.
2.5 Verificando a proximidade semântica no modelo otimizado
Para validar a precisão da absorção dos 33 registros recuperados, efetuou-se uma auditoria qualitativa que confirmou a aderência ao Tópico 6. Complementarmente, procedeu-se à verificação quantitativa por meio do cálculo da similaridade de cosseno, aplicada sobre uma amostra estratificada representativa de 20% do volume total do Tópico 6 otimizado (34 das 170 narrativas). O objetivo foi mensurar a proximidade dessas narrativas em relação ao centroide do agrupamento:
Resultados Estatísticos da Amostra
Média Geral da Amostra: 0,5759
Maior Similaridade Encontrada: 0,6914
Menor Similaridade Encontrada: 0,3691
Top 3 narrativas da amostra mais próximos do núcleo:
"[We had] fumes in cockpit and forward cabin. [..." (Score: 0,6914)
"At approximately, XA:40 local, the Purser info..." (Score: 0,6812)
"In cruise flight at FL360, Captain and First O..." (Score: 0,6775)
A média de 0,5759 e o valor máximo de 0,6914 atestam que a realocação não foi artificial, mas embasada em sólida coesão vetorial. Sob uma perspectiva analítica, o experimento demonstrou que, embora 10,2% do ruído inicial (183 de 1.783) tenha sido selecionado pelo filtro TF-IDF, apenas 18,0% desse subconjunto (33 de 183) detinha afinidade real com a temática do Tópico 6.
Adicionalmente, 81,9% (150 de 183) dos registros filtrados foram redirecionados para outros agrupamentos, enquanto 0% permaneceu como ruído. Esses indicadores confirmam que a técnica de reduce_outliers() atua como um mecanismo preciso de organização, eliminando a dispersão vetorial que anteriormente invisibilizava 24,6% do conteúdo crítico que deveria compor o Tópico 6. O resgate desses 33 relatos, somado à expansão total do Tópico 6 de 134 para 170 narrativas, resulta em um crescimento de 26,9% no volume do cluster, restabelecendo narrativas que apresentavam forte associação com o domínio olfativo.
3. Conclusão
Este trabalho demonstrou que a classificação de narrativas como ruído (-1) por algoritmos de densidade limita a identificação de tópicos relevantes. A aplicação do reduce_outliers() provou ser um método eficaz para mitigar essa perda, garantindo uma representação temática fidedigna.
A eficácia do procedimento foi quantificada pelo crescimento de 26,9% no volume de narrativas do Tópico 6 após a aplicação do *reduce_outliers(*). Embora 10,2% do ruído inicial (183 de 1.783) apresentasse afinidade lexical, a aplicação do *reduce_outliers()* permitiu uma redistribuição precisa: 18,0% (33 narrativas) foram incorporadas ao Tópico 6 e 81,9% (150 narrativas) foram realocadas para outros grupos, reduzindo a taxa de ruído remanescente da amostra para 0%.
Conclui-se, portanto, que a análise de dados em segurança operacional deve transcender critérios estritos de densidade. O uso do *reduce_outliers()* prioriza a similaridade vetorial, contribuindo para uma representação mais completa dos dados ao evitar que parte do volume informativo associado a um tópico seja não capturada pelo critério de densidade, sendo posteriormente reatribuída por similaridade vetorial.
메타데이터
- post_id
- c38089c2b2cd
- slug
- a-aplicação-do-reduce-outliers-na-identificação-de-incidentes-de-segurança-aérea-2010-2020-c38089c2b2cd
- url
- https://medium.com/@anyapisani/a-aplica%C3%A7%C3%A3o-do-reduce-outliers-na-identifica%C3%A7%C3%A3o-de-incidentes-de-seguran%C3%A7a-a%C3%A9rea-2010-2020-c38089c2b2cd
- canonical_url
- https://medium.com/@anyapisani/a-aplica%C3%A7%C3%A3o-do-reduce-outliers-na-identifica%C3%A7%C3%A3o-de-incidentes-de-seguran%C3%A7a-a%C3%A9rea-2010-2020-c38089c2b2cd
- author_url
- https://medium.com/@anyapisani
- status
- ok
- fetched_at
- 2026-06-22 05:50:54