← Back to list

Hacia un Embedding Ternario de Coherencia Recursiva en Aurora

Encoder Proyecto genesis — conamed: Butterfly

Aurora Program · 2026-05-05 16:50 · 1 claps · 12.0 min read
#autoencoder #ai #csp #aurora-program #embedding
Open on Medium ↗
Wiki topics: RAG · RAG & Retrieval AI · AI · General

Hacia un Embedding Ternario de Coherencia Recursiva en Aurora

Encoder Proyecto genesis — conamed: Butterfly

Resumen

Los sistemas actuales de inteligencia artificial basados en lenguaje utilizan representaciones vectoriales o embeddings aprendidos principalmente a partir de patrones estadísticos. Estas representaciones han demostrado una eficacia indiscutible, pero requieren grandes volúmenes de datos, entrenamientos costosos y un consumo energético muy elevado.

Este artículo propone una vía alternativa: un modelo de representación semántica basado en tensores ternarios, reglas de identidad y consolidación recursiva del conocimiento. En lugar de derivar el significado únicamente de la probabilidad de coaparición entre palabras, el sistema propuesto busca que los tokens evolucionen sus representaciones internas para preservar la coherencia entre entrada y salida bajo una regla fundamental: cuando no hay conocimiento suficiente, la salida debe coincidir exactamente con la entrada.

El modelo se apoya en tres valores discretos: 0, 1 y 2, donde 2 representa desconocimiento. Una de las hipótesis centrales es que los tensores de palabras y los tensores de conocimiento son intercambiables. Esto permite representar tokens, frases, reglas y conceptos dentro de un mismo espacio lógico-tensorial.

1. Introducción

Los embeddings actuales han transformado el procesamiento del lenguaje natural. Mediante el análisis de enormes corpus textuales, los modelos aprenden que ciertas palabras aparecen en contextos similares y, por tanto, pueden ocupar regiones próximas en un espacio vectorial.

Este enfoque ha producido resultados extraordinarios. Sin embargo, también presenta limitaciones importantes:

  • requiere grandes cantidades de texto;
  • depende de entrenamientos computacionalmente intensivos;
  • utiliza representaciones de alta dimensionalidad con valores continuos;
  • puede generar respuestas plausibles incluso cuando el sistema no posee conocimiento real;
  • no distingue de forma estructural entre conocimiento consolidado y desconocimiento.

Aurora explora una dirección distinta. La propuesta no parte de la acumulación estadística masiva, sino de la consolidación progresiva de coherencia.

El objetivo no es negar el valor de los embeddings clásicos, sino investigar si puede existir una representación más eficiente, discreta y lógica del significado.

2. Hipótesis principal

La hipótesis central puede formularse así:

El significado de un token puede emerger de las restricciones necesarias para conservar la identidad, la reconstrucción y la coherencia dentro de un sistema recursivo de tensores ternarios.

En este enfoque, una palabra no obtiene su significado únicamente porque aparece cerca de otras palabras. Lo obtiene porque su tensor debe evolucionar para que múltiples estructuras lingüísticas y conceptuales puedan mantenerse coherentes entre sí.

Dicho de otro modo, el sistema no pregunta solamente:

¿Qué palabras suelen aparecer juntas?

Sino:

¿Qué representación interna debe adoptar cada token para que todas las frases conocidas sean reconstruibles, coherentes y compatibles entre sí?

3. Representación ternaria

El modelo utiliza una codificación ternaria:

0 = falso / negación / ausencia

1 = verdadero / afirmación / presencia

2 = desconocido / indeterminado / no consolidado

El valor 2 es especialmente importante. No representa un simple vacío, sino una forma explícita de incertidumbre. El sistema no está obligado a inventar una relación cuando no la conoce. Puede conservar el estado de desconocimiento hasta que aparezca información suficiente para consolidarlo.

Esto introduce una diferencia fundamental respecto a muchos modelos generativos actuales: el desconocimiento forma parte de la arquitectura.

4. Regla de identidad

La regla base del sistema es:

Cuando no existe conocimiento suficiente, la salida debe coincidir exactamente con la entrada.

Formalmente, si X es una entrada y K representa el conocimiento disponible, entonces:

si K = desconocido,

entonces salida(X, K) = X

Esta regla cumple varias funciones:

  1. Evita que el sistema genere transformaciones arbitrarias.
  2. Establece una condición mínima de estabilidad.
  3. Permite que el aprendizaje se mida como reducción progresiva de desconocimiento.
  4. Obliga a que toda modificación de la salida esté justificada por conocimiento consolidado.

La identidad no es una limitación, sino el punto de partida de la inteligencia del sistema.

5. Intercambiabilidad entre palabra y conocimiento

Una de las ideas centrales de Aurora es que los tensores de palabra y los tensores de conocimiento son intercambiables.

En los sistemas clásicos suele existir una separación entre:

token → representación interna

conocimiento → regla, parámetro o estructura externa

En Aurora, esta separación se reduce:

token = conocimiento parcial

conocimiento = tensor expresable como token

Esto significa que una palabra, una frase, una regla o un concepto pueden representarse dentro del mismo tipo de estructura tensorial.

Por ejemplo:

“fuego”

“el fuego quema”

“quemar implica calor”

“el hielo no quema”

Cada una de estas unidades puede tener una representación tensorial. La diferencia entre palabra, frase y conocimiento no es de naturaleza, sino de complejidad y grado de consolidación.

6. Aprendizaje por consolidación recursiva

El aprendizaje se produce al introducir frases coherentes e inteligentes donde aparecen determinados tokens. Al principio, los tensores contienen un alto grado de desconocimiento. A medida que se agregan ejemplos, el sistema debe ajustar sus tensores para cumplir la regla de identidad y preservar la coherencia.

Supongamos las siguientes frases:

el fuego quema

el fuego calienta

el hielo enfría

el agua moja

el sol ilumina

El token fuego empieza con un tensor parcialmente desconocido. Al aparecer en frases coherentes, se consolidan relaciones con otros tokens como quema, calienta, calor, energía o peligro.

Pero estas relaciones no se aprenden solo por proximidad estadística. Se consolidan porque son necesarias para que el sistema reconstruya y mantenga coherentes las frases conocidas.

A su vez, los tokens relacionados también evolucionan. El tensor de quema puede influir sobre calor, daño, transformación o peligro. Así, el significado se propaga de forma recursiva.

7. Diferencia frente al embedding probabilístico

El embedding probabilístico clásico puede resumirse así:

Una palabra se representa según los contextos en los que aparece.

El embedding ternario de coherencia recursiva puede resumirse así:

Una palabra se representa según las condiciones necesarias para conservar la coherencia de las estructuras en las que participa.

La diferencia es profunda.

En el primer caso, el significado emerge de la frecuencia y la distribución.

En el segundo, emerge de la identidad, la reconstrucción y la compatibilidad lógica.

Esto no implica que el modelo de Aurora deba rechazar toda estadística. La frecuencia puede ser útil. Pero no sería el fundamento último del significado. El fundamento sería la coherencia.

8. Ventajas potenciales

El enfoque propuesto podría ofrecer varias ventajas:

8.1. Menor coste energético

Al utilizar valores discretos ternarios en lugar de grandes matrices de valores continuos, el sistema podría reducir el coste computacional y energético asociado al entrenamiento y la inferencia.

8.2. Representación explícita del desconocimiento

El valor 2 permite distinguir entre lo falso, lo verdadero y lo desconocido. Esto puede ayudar a reducir respuestas inventadas o no justificadas.

8.3. Aprendizaje incremental

El sistema puede consolidar conocimiento progresivamente sin necesidad de reentrenar desde cero grandes modelos completos.

8.4. Mayor interpretabilidad

Las relaciones ternarias pueden ser más fáciles de auditar que vectores continuos de alta dimensionalidad.

8.5. Unificación entre lenguaje y conocimiento

La intercambiabilidad entre tensores de palabra y tensores de conocimiento permite tratar frases, reglas y conceptos dentro de una misma arquitectura.

9. Riesgos y dificultades

La propuesta también presenta retos importantes:

9.1. Explosión combinatoria

Si cada token puede relacionarse con muchos otros tokens y conocimientos, el número de tensores puede crecer rápidamente.

9.2. Gestión de contradicciones

El sistema debe distinguir entre contradicción real, excepción contextual y desconocimiento.

Por ejemplo:

el fuego quema

el fuego no quema en una simulación

Ambas frases pueden ser coherentes en contextos distintos.

9.3. Definición de coherencia

Es necesario definir formalmente qué significa que una frase sea coherente. La coherencia puede ser sintáctica, semántica, lógica o pragmática.

9.4. Actualización mínima

Cuando una nueva frase obliga a modificar tensores, el sistema debe hacerlo alterando lo mínimo posible para no destruir conocimientos ya consolidados.

9.5. Evaluación experimental

Será necesario comparar este enfoque con embeddings clásicos en tareas concretas: reconstrucción, clasificación, analogía, razonamiento básico y detección de contradicciones.

10. Propuesta experimental inicial

Un primer experimento podría realizarse con un corpus muy pequeño de frases simples:

el fuego quema

el fuego calienta

el hielo enfría

el agua moja

el sol ilumina

la luz permite ver

el cuchillo corta

la comida alimenta

Objetivos del experimento:

  1. Inicializar tensores ternarios con predominio de 2.
  2. Introducir frases una a una.
  3. Aplicar la regla de identidad.
  4. Ajustar tensores para conservar reconstrucción exacta.
  5. Medir reducción de desconocimiento.
  6. Evaluar si el sistema detecta coherencia en frases nuevas.

Frases de prueba:

el fuego da calor

el hielo no quema

la luz ilumina

el agua alimenta

El sistema debería poder distinguir entre:

  • relaciones consolidadas;
  • relaciones plausibles pero no consolidadas;
  • relaciones contradictorias;
  • relaciones desconocidas.

11. Formulación preliminar

Podemos definir cada token t como un tensor ternario:

T(t) ∈ {0,1,2}^n

Un conocimiento k también se representa como tensor:

T(k) ∈ {0,1,2}^n

De este modo:

T(token) ↔ T(conocimiento)

La función del sistema es encontrar una transformación F tal que:

F(entrada, conocimiento) = salida

Y bajo desconocimiento:

F(X, 2) = X

El aprendizaje consiste en actualizar los tensores para reducir 2 cuando existan evidencias suficientes, sin romper las reconstrucciones ya válidas.

12. Principio de mínima alteración coherente

Para evitar que el sistema modifique de forma destructiva sus representaciones, se propone un principio adicional:

Ante nueva información, el sistema debe realizar la menor modificación tensorial posible que restaure la coherencia local sin romper la coherencia global.

Este principio es fundamental para permitir aprendizaje incremental.

13. Conclusión

Aurora propone explorar una vía alternativa para la representación del significado. En lugar de depender exclusivamente de embeddings probabilísticos entrenados sobre enormes corpus, plantea un modelo de tensores ternarios donde palabra y conocimiento son intercambiables, y donde el aprendizaje surge de la necesidad de preservar identidad y coherencia.

La propuesta no pretende sustituir inmediatamente a los métodos actuales, sino abrir una línea de investigación hacia inteligencias más eficientes, interpretables y conscientes de su propio desconocimiento.

El principio esencial puede resumirse así:

El significado no nace solo de contar palabras, sino de conservar la coherencia entre ellas.

O, en términos de Aurora:

Una palabra es conocimiento en proceso de consolidación, y el conocimiento es una palabra que ha aprendido a sostener coherencia.

Frase como ecuación, token como incógnita La forma más sencilla de entender este proceso es imaginar un sistema de ecuaciones con múltiples incógnitas. Si conocemos x = 2, una nueva ecuación como x + y = 5 permite deducir y = 3. Después, si aparece x — z = 1, podemos deducir z = 1. Finalmente, una relación como y + z = v permite resolver v = 4.

En Aurora ocurre algo análogo. Un token semilla actúa como una primera variable parcialmente conocida. Cada frase funciona como una ecuación semántica que relaciona varios tokens (sus representaciones tensoriales). Cuando algunos tokens ya están consolidados, ayudan a restringir los demás. Así, el conocimiento no se asigna directamente, sino que se propaga por relaciones.

El aprendizaje surge del encadenamiento de restricciones: una frase resuelve parcialmente ciertos tokens; esos tokens ayudan a resolver frases posteriores; y las frases posteriores consolidan nuevos tensores.

Nota: Las operaciones reales en Aurora no son aritméticas, sino lógicas ternarias (combinaciones de Trigates, ordenación y emergencia). Y los valores son trits 0,1,2 o tensores de estos, no números enteros. Sin embargo, la idea de restricción y propagación es idéntica: cada nueva frase reduce el dominio de posibilidades hasta que, cuando hay suficiente información, algunos valores quedan determinados y ayudan a resolver otros.

Así, el sistema se asemeja más a un solver de restricciones que a un modelo estadístico. Cada frase es una ecuación, cada token una incógnita, y el conocimiento consiste en el conjunto de soluciones coherentes con todas las ecuaciones vistas hasta el momento.

Apéndice A

Mitosis semántica: resolución de polisemia por tensión lógica

Una consecuencia natural del embedding ternario de coherencia recursiva es que un token no tiene por qué corresponder siempre a un único tensor definitivo.

En los embeddings clásicos, una palabra tiende a ocupar una posición dentro de un espacio vectorial. Aunque los modelos modernos puedan contextualizar esa representación, la palabra sigue dependiendo de una arquitectura que normalmente integra múltiples usos dentro de distribuciones estadísticas compartidas.

Aurora propone otra posibilidad: un token puede funcionar como una etiqueta de acceso a una familia de tensores.

Esto permite resolver de forma más clara fenómenos como la polisemia, la metáfora o los cambios de dominio.

Por ejemplo, la palabra banco no tendría que comprimirse en una única representación media. Podría bifurcarse en varios tensores coherentes:

T(banco)_1 → asiento / madera / parque / descanso T(banco)_2 → dinero / crédito / interés / cuenta T(banco)_3 → banco de peces / conjunto / agrupación

El token superficial sigue siendo el mismo:

banco

pero el sistema aprende que esa etiqueta puede apuntar a diferentes tensores según el contexto de coherencia.

A.1. El token como nodo elástico

En este modelo, un token no debe entenderse como una entidad rígida, sino como un nodo elástico.

Al principio, el token puede tener un tensor abierto:

T(banco) = 222

A medida que aparecen frases, el sistema intenta consolidar relaciones.

Por ejemplo:

El banco está en el parque. El banco es de madera. Me senté en el banco.

Estas frases tienden a consolidar un tensor asociado al significado de banco como asiento:

T(banco)_asiento

Después aparece una frase nueva:

El banco ofrece créditos.

Si el sistema intenta resolver esta frase usando T(banco)_asiento, aparece una tensión fuerte. El tensor asociado a asiento no permite reconstruir de forma coherente relaciones como:

crédito dinero cuenta interés

Entonces el sistema no debe promediar ambos significados ni corromper el tensor anterior.

Debe detectar que existe una nueva región de significado.

A.2. Tensión lógica como disparador de bifurcación

La tensión puede entenderse como una medida de incompatibilidad entre una frase nueva y los tensores disponibles.

Conceptualmente:

Tensión = contradicciones directas

  • incapacidad de reconstrucción
  • coste de alterar conocimiento consolidado

Si la tensión es baja, el sistema puede ajustar el tensor existente.

Si la tensión es media, puede mantener el estado abierto y esperar más frases.

Si la tensión supera un umbral crítico, el sistema interpreta que no está ante una simple variación, sino ante un nuevo dominio de conocimiento.

Entonces se produce una bifurcación.

A esta bifurcación podemos llamarla:

mitosis semántica

La mitosis semántica ocurre cuando un token genera un nuevo tensor para preservar la coherencia de un nuevo contexto sin destruir el conocimiento anterior.

T(token)_1 → tensor consolidado previo T(token)_2 → nuevo tensor abierto para el nuevo dominio

El nuevo tensor nace inicialmente en apertura:

T(banco)_financiero = 222

y empieza a consolidarse con frases como:

El banco ofrece créditos. El banco guarda dinero. El banco cobra intereses. El banco abre cuentas.

A.3. Diferencia entre error y nuevo dominio

Esta distinción es importante.

No toda tensión debe generar una nueva rama. Algunas tensiones indican error, contradicción real o información insuficiente.

Aurora debería distinguir al menos tres casos:

  1. Tensión resoluble: la frase puede integrarse ajustando mínimamente el tensor existente.

  2. Tensión abierta: no hay suficiente información; se conserva apertura.

  3. Tensión crítica: la frase no encaja con el tensor existente sin destruir coherencia previa. Se genera una nueva rama tensorial.

Por ejemplo:

El banco está en el parque. El banco ofrece créditos.

probablemente exige dos tensores distintos.

Pero:

El banco del parque es antiguo. El banco del parque está roto.

no exige bifurcación; son variaciones compatibles del mismo tensor.

A.4. Resolución de polisemia

La polisemia deja de ser un problema de mezcla y pasa a ser un problema de selección contextual.

Ante una frase nueva, el sistema evalúa qué tensor del token permite mayor coherencia.

Por ejemplo:

F = “El banco aprobó el préstamo.”

El sistema compara:

T(banco)_asiento T(banco)_financiero T(banco)_agrupación

y selecciona el tensor que permite reconstruir la frase con menor tensión y mayor coherencia:

T(banco)_financiero

La regla sería:

Seleccionar T(token)_i tal que minimice la tensión contextual y maximice la coherencia de reconstrucción.

Si ningún tensor disponible permite reconstruir la frase con coherencia suficiente, el sistema puede crear una nueva rama:

T(token)_nuevo = 222

A.5. Protección del conocimiento previo

La mitosis semántica también protege el conocimiento consolidado.

En muchos sistemas de aprendizaje, incorporar información nueva puede alterar representaciones previas. Esto se relaciona con el problema del olvido catastrófico.

Aurora puede reducir este riesgo mediante ramificación.

Si una nueva frase tensiona demasiado un tensor consolidado, el sistema no necesita deformarlo. Puede crear una nueva rama y conservar intacta la anterior.

Ejemplo:

El mercurio es un planeta.

Consolida:

T(mercurio)_astro

Luego aparece:

El mercurio es un metal líquido.

Si el sistema intenta integrar esta frase en el mismo tensor, surge una tensión crítica:

planeta ↔ metal líquido

En lugar de borrar o deformar el conocimiento astronómico, Aurora crea una segunda rama:

T(mercurio)_astro → planeta / órbita / sistema solar T(mercurio)_químico → metal / líquido / elemento / temperatura

Así, el token mercurio se convierte en una etiqueta que apunta a varias estructuras coherentes.

A.6. Metáfora y lenguaje poético

La misma lógica puede aplicarse a usos metafóricos.

Por ejemplo:

El fuego quema.

puede consolidar un tensor físico/químico:

T(fuego)_físico → calor / combustión / quema / energía

Pero una frase como:

Había fuego en su mirada.

no debe destruir el conocimiento físico sobre el fuego.

Tampoco debe interpretarse literalmente como combustión ocular.

Debe generar o activar una rama metafórica:

T(fuego)_metafórico → intensidad / pasión / energía emocional

De este modo, Aurora podría separar dominios sin perder conexiones.

La metáfora no sería un error. Sería una bifurcación contextual controlada.

A.7. Estructura cristalina del conocimiento

La mitosis semántica convierte el aprendizaje en un crecimiento ramificado.

En lugar de una masa continua de probabilidades donde los significados se mezclan, Aurora tendería a formar una estructura más parecida a un cristal:

token ├── tensor contextual 1 ├── tensor contextual 2 ├── tensor contextual 3 └── tensor contextual n

Cada rama conserva coherencia interna.

Cada nueva frase puede:

  1. reforzar una rama existente;
  2. abrir una rama nueva;
  3. conectar ramas mediante relaciones superiores;
  4. marcar contradicción si no hay integración posible.

Esto permite que el sistema crezca sin tener que destruir lo aprendido.

A.8. Formulación preliminar

Podemos representar un token polisémico como una familia de tensores:

Token(w) = {T(w)_1, T(w)_2, …, T(w)_n}

Dada una frase F, el sistema busca:

T(w)_i compatible con F

según una función de coherencia:

C(F, T(w)_i)

y una función de tensión:

Λ(F, T(w)_i)

El tensor seleccionado sería:

T(w)* = argmin Λ(F, T(w)_i)

siempre que la tensión esté por debajo de un umbral aceptable.

Si ningún tensor existente satisface la frase:

min Λ(F, T(w)_i) > umbral crítico

entonces se crea una nueva rama:

T(w)_{n+1} = 222

que comenzará a consolidarse con las nuevas restricciones.

A.9. Conclusión del apéndice

La mitosis semántica permite que Aurora gestione la polisemia, la metáfora y los cambios de dominio sin promediar significados incompatibles.

Un token deja de ser una representación única y pasa a ser una entrada hacia una familia de tensores contextuales. Cada tensor conserva una región de coherencia. Cuando una frase nueva no puede integrarse sin romper conocimiento previo, el sistema genera una nueva rama en apertura.

Así, el aprendizaje no ocurre por deformación global, sino por crecimiento estructurado.

Aurora no mezcla todos los significados en un único punto medio: permite que el lenguaje se bifurque allí donde la coherencia lo exige.

Esta idea refuerza una de las intuiciones centrales del modelo:

El conocimiento no debe crecer como una masa amorfa de probabilidades, sino como una estructura viva de tensores coherentes que se ramifican, se conectan y se protegen entre sí.


메타데이터
post_id
5536b0764c8a
slug
hacia-un-embedding-ternario-de-coherencia-recursiva-en-aurora-5536b0764c8a
url
https://medium.com/@pab.man.alvarez/hacia-un-embedding-ternario-de-coherencia-recursiva-en-aurora-5536b0764c8a
canonical_url
https://medium.com/@pab.man.alvarez/hacia-un-embedding-ternario-de-coherencia-recursiva-en-aurora-5536b0764c8a
author_url
https://medium.com/@pab.man.alvarez
status
ok
fetched_at
2026-06-10 18:44:10