← Back to list

Perplexity Brain pero hecho casa

Construí un sistema de memoria agéntica auto-mejorable en 5 horas inspirado en Perplexity Brain, a 800x menor costo

Javier Alcívar · 2026-06-19 05:39 · 0 claps · 6.9 min read
#perplexity #perplexity-brain #ai-memory
Open on Medium ↗

Perplexity Brain pero hecho casa

Construí un sistema de memoria agéntica auto-mejorable en 5 horas inspirado en Perplexity Brain, a 800x menor costo

Por Javier Alcivar Forward Deploy Designer & AI Product Builder

Hace una semana, Perplexity lanzó algo llamado Brain: un sistema de memoria auto-mejorable para sus agentes que reporta +25% de precisión, +16% de recall y −13% en costos por tarea después de solo unos días de uso.

El catch: está incluido en Perplexity Max a $200/mes o Perplexity Computer, que es incluso más caro.

Para un producto SaaS bootstrapped construido para el mercado latinoamericano, eso no es una opción. Así que decidí replicar la arquitectura desde cero, usando la infraestructura que ya tenía.

El resultado: el mismo patrón de memoria auto-mejorable, corriendo en producción en AInstantly el motor antifraude para WhatsApp Commerce en Ecuador a un costo operativo de $0.24/mes.

Esto es lo que construí y cómo.

El problema que quería resolver

AInstantly detecta fraude en comprobantes de transferencia bancaria enviados por WhatsApp. Ecuador tiene 23 bancos privados, 4 públicos y más de 393 cooperativas casi ninguno con API pública. Eso significa que cada validación es OCR + visión artificial + heurísticas, sin red de seguridad de un banco central se hace al ojo por cada comerciante.

El problema: cada análisis empezaba desde cero. El agente no recordaba que la semana pasada aprendió que los comprobantes de Cooperativa JEP con timestamp inconsistente son señal de fraude en un 89% de los casos. No recordaba que cuando un operador rechazaba su veredicto, lo corregía casi siempre por el mismo patrón.

Cada sesión = amnesia total.

La arquitectura de Perplexity Brain (simplificada)

Perplexity Brain hace tres cosas fundamentales:

  1. Registra cada sesión qué hizo el agente, qué funcionó, qué falló, qué corrigió un humano
  2. Sintetiza nocturnamente un LLM comprime los logs del día en un memo estructurado de aprendizajes
  3. Inyecta el contexto al inicio de cada nueva sesión, el agente recibe el wiki actualizado como contexto enriquecido

Separa work memory (logs crudos de sesiones) de knowledge memory (wiki sintetizada). Esta separación es lo que mantiene los costos de inferencia bajo control: el agente no lee 500 sesiones brutas, lee un resumen comprimido de 600 tokens.

Cómo lo repliqué en 5 horas

Hora 1 Modelos de datos

Dos tablas en PostgreSQL (ya tenía Prisma corriendo):

AgentSessionLog work memory:

  • agentType: fraud_detector / sales_agent / cobros
  • outcome: success / failed / escalated
  • humanCorrection: el texto exacto cuando un operador corrige al agente ← señal más valiosa
  • hadBrainContext + brainContextHash: campos de benchmark para medir el impacto con/sin Brain

KnowledgeWiki knowledge memory:

  • Un registro por agentType con doc_id fijo (upsert = reemplazar, no acumular)
  • memosJson: ventana rolling de 14 días de memos
  • wikiVersion: entero autoincremental “este análisis usó la versión 12 del wiki”

Hora 2 Write path (registrar sesiones)

Hookeé el logger en dos lugares:

  1. POST /api/payments/[id]/analyze cada análisis de fraude escribe su sesión automáticamente
  2. PUT /api/payments/[id] cuando un operador aprueba o rechaza, el sistema detecta si fue una corrección (humano en desacuerdo con la IA) y la registra como señal de alta prioridad

Hora 3 Nightly synthesis job

Una función que corre a las 01:30 AM hora Ecuador:

El prompt le pide explícitamente al LLM que considere el contexto ecuatoriano: nombres de bancos, formatos de comprobantes, tipos de comerciante. No es un memo genérico es conocimiento específico del dominio.

Costo del LLM call: ~$0.006/noche con Gemini Flash.

Hora 4 Read path (inyección de contexto)

Antes de cada análisis de fraude, el sistema recupera el wiki del fraud_detector y lo prepende al system prompt:

El agente ahora sabe lo que aprendió ayer antes de ver el comprobante de hoy.

Hora 5 Dashboard admin + seed data

Un dashboard en /admin/brain con KPIs en tiempo real, comparación benchmark con/sin Brain, visor expandible del wiki y botón de síntesis manual. Más 16 sesiones seed con casos reales (fraudes documentados en nuestro paper de investigación) para que el primer wiki ya tuviera señal útil.

Comparación de costos: lo que hubiera costado

Fuentes: pricing verificado junio 2026 en sitios oficiales de cada producto

La diferencia no es solo de precio. Es de propiedad: el Brain que construí es white-labelable para el deal enterprise que estoy cerrando con una aseguradora. Un sistema Mem0 o Zep no me pertenece; este sí.

Qué mejora en tu producto cuando tienes memoria agéntica

Este es el punto que creo que más se subestima al hablar de estos sistemas:

La memoria no hace que el agente sea más inteligente. Lo hace más relevante.

Un agente sin memoria es un consultor que llega a cada reunión sin haber leído los emails anteriores. Técnicamente capaz, contextualmente ciego.

Con memoria agéntica auto-mejorable:

  • Reduce falsos positivos el agente recuerda que cierto formato de cooperativa genera alarma por razones técnicas (no fraude real) y ajusta su umbral
  • Aprende de las correcciones humanas sin reentrenamiento cada override de un operador se convierte en una regla nueva en el wiki overnight, sin tocar el modelo base
  • Personaliza por dominio un wiki para fraud_detector, otro para sales_agent, otro para cobros. Cada uno aprende de sus propios datos, no de los de los otros
  • Construye un moat defensible después de 6 meses de operación, tu wiki tiene patrones específicos de Ecuador que ningún competidor que empiece hoy puede replicar en semanas

El +25% de precisión que reporta Perplexity Brain no viene del modelo, viene de no empezar desde cero cada vez.

El factor humano

La corrección humana siempre gana, pero no “anula” enseña

El sistema no prioriza una señal sobre otra en tiempo real como un sistema de reglas con pesos. En su lugar, opera en dos tiempos:

Tiempo real (análisis):

  • Las reglas (OCR, metadatos EXIF, artefactos JPEG, coherencia semántica, señales conversacionales) producen un riskScore + señales + veredicto recomendado
  • Pero el sistema nunca rechaza automáticamente — es Human-in-the-Loop por diseño. El veredicto llega al operador humano como insumo, no como decisión final
  • Si el operador anula la decisión, el campo humanCorrection registra el texto exacto de la razón (no solo "safe"/"fraud")

Tiempo diferido (síntesis nocturna):

  • El campo humanCorrection es tratado como la señal de mayor valor (sección 6.2 del paper)
  • Un outcome: failed con corrección tipo "el comprobante es de Cooperativa Atuntaqui, no de JEP — el formato es diferente" genera una calibración mucho más específica que un simple outcome: success
  • La síntesis nocturna (Gemini Flash, 01:30 AM ECT) procesa estos casos y actualiza el wiki con PATTERNS_THAT_FAILED y CALIBRATION_UPDATES
  • La próxima vez que el detector analice un caso similar, el wiki inyectado ya contiene esa corrección

No hay capa de pesos — hay aprendizaje por síntesis

La diferencia clave con un sistema de pesos tradicional: no hay un número que diga “regla X tiene peso 0.7, feedback humano 0.9”. Lo que hay es un wiki en lenguaje natural que el LLM consume como contexto. Cuando hay conflicto entre lo que las reglas detectan y lo que el operador dice, el wiki lo resuelve semánticamente — por ejemplo:

“Comprobantes de Cooperativa Atuntaqui usan formato similar a JEP pero con logo diferente. No clasificar como duplicado si la institución difiere.”

Eso no es un peso numérico — es una calibración contextual que el modelo aplica en inferencia.

Protecciones contra ruido humano

El paper reconoce en la sección 8.1 que operadores inconsistentes pueden introducir ruido. Las protecciones son:

  • Ventana rolling de 14 días — el wiki se auto-depura descartando memos antiguos
  • Spot-check post-síntesis — 3 fraudes conocidos + 3 limpios conocidos se re-evalúan con cada wiki nuevo. Si la precisión cae debajo del 80%, se activa alerta
  • **wikiVersion tracking** — permite correlacionar qué versión del wiki causó regresiones y revertir

En resumen: las reglas proponen, el humano dispone, y la síntesis nocturna convierte ese feedback en conocimiento reutilizable. No hay conflicto — hay ciclo de aprendizaje.

Lo que sigue

El sistema está corriendo en dev.ainstantly.ai. En las próximas semanas:

  1. Medir el benchmark real hadBrainContext = true vs false sobre las primeras 200 sesiones de producción
  2. Extender a sales_agent el mismo pipeline para el agente de recuperación de carritos abandonados (“Recupera clientes que te dejaron en visto”)
  3. Open source del patrón publicar la arquitectura base como módulo reutilizable bajo el proyecto ainstantly.ai/detecciondeestafas

Para el Forward Deploy Designer

El título de este post no es accidental. “Forward Deploy Designer” no significa que diseñas interfaces significa que llegas al problema antes que el equipo de ingeniería, construyes el prototipo funcional, y defines el estándar que el equipo después escala.

Esto es exactamente lo que pasó aquí:

  • Leí el paper de Perplexity Brain el día que salió
  • Identifiqué el patrón arquitectónico relevante para mi producto
  • Lo implementé en 5 horas usando las herramientas que ya tenía
  • Ahora tengo un asset demostrable antes de que ningún competidor regional lo haya considerado

No necesité un equipo de ML. No necesité $200/mes. Necesité entender el patrón y saber conectar las piezas.

Ese es el trabajo del Forward Deploy Designer en 2026: ver la investigación, traducirla en producto, moverla a producción.

¿Estás construyendo sistemas de memoria para tus agentes? ¿Qué arquitectura estás usando y cuál es tu costo operativo real? Comenta abajo me interesa comparar notas.

Sigo el progreso de AInstantly en

*ainstantly.ai*

. El paper técnico sobre fraude por transferencias en Ecuador está en

*ainstantly.ai/detecciondeestafas*


메타데이터
post_id
e4df7284b7fc
slug
perplexity-brain-pero-hecho-casa-e4df7284b7fc
url
https://medium.com/@javieralcivar/perplexity-brain-pero-hecho-casa-e4df7284b7fc
canonical_url
https://medium.com/@javieralcivar/perplexity-brain-pero-hecho-casa-e4df7284b7fc
author_url
https://medium.com/@javieralcivar
status
ok
fetched_at
2026-06-21 09:28:28