Perplexity Brain pero hecho casa
Construí un sistema de memoria agéntica auto-mejorable en 5 horas inspirado en Perplexity Brain, a 800x menor costo
Perplexity Brain pero hecho casa
Construí un sistema de memoria agéntica auto-mejorable en 5 horas inspirado en Perplexity Brain, a 800x menor costo
Por Javier Alcivar Forward Deploy Designer & AI Product Builder

Hace una semana, Perplexity lanzó algo llamado Brain: un sistema de memoria auto-mejorable para sus agentes que reporta +25% de precisión, +16% de recall y −13% en costos por tarea después de solo unos días de uso.
El catch: está incluido en Perplexity Max a $200/mes o Perplexity Computer, que es incluso más caro.
Para un producto SaaS bootstrapped construido para el mercado latinoamericano, eso no es una opción. Así que decidí replicar la arquitectura desde cero, usando la infraestructura que ya tenía.
El resultado: el mismo patrón de memoria auto-mejorable, corriendo en producción en AInstantly el motor antifraude para WhatsApp Commerce en Ecuador a un costo operativo de $0.24/mes.
Esto es lo que construí y cómo.
El problema que quería resolver
AInstantly detecta fraude en comprobantes de transferencia bancaria enviados por WhatsApp. Ecuador tiene 23 bancos privados, 4 públicos y más de 393 cooperativas casi ninguno con API pública. Eso significa que cada validación es OCR + visión artificial + heurísticas, sin red de seguridad de un banco central se hace al ojo por cada comerciante.

El problema: cada análisis empezaba desde cero. El agente no recordaba que la semana pasada aprendió que los comprobantes de Cooperativa JEP con timestamp inconsistente son señal de fraude en un 89% de los casos. No recordaba que cuando un operador rechazaba su veredicto, lo corregía casi siempre por el mismo patrón.
Cada sesión = amnesia total.
La arquitectura de Perplexity Brain (simplificada)
Perplexity Brain hace tres cosas fundamentales:
- Registra cada sesión qué hizo el agente, qué funcionó, qué falló, qué corrigió un humano
- Sintetiza nocturnamente un LLM comprime los logs del día en un memo estructurado de aprendizajes
- Inyecta el contexto al inicio de cada nueva sesión, el agente recibe el wiki actualizado como contexto enriquecido
Separa work memory (logs crudos de sesiones) de knowledge memory (wiki sintetizada). Esta separación es lo que mantiene los costos de inferencia bajo control: el agente no lee 500 sesiones brutas, lee un resumen comprimido de 600 tokens.
Cómo lo repliqué en 5 horas
Hora 1 Modelos de datos
Dos tablas en PostgreSQL (ya tenía Prisma corriendo):
AgentSessionLog work memory:
- agentType: fraud_detector / sales_agent / cobros
- outcome: success / failed / escalated
- humanCorrection: el texto exacto cuando un operador corrige al agente ← señal más valiosa
- hadBrainContext + brainContextHash: campos de benchmark para medir el impacto con/sin Brain
KnowledgeWiki knowledge memory:
- Un registro por agentType con doc_id fijo (upsert = reemplazar, no acumular)
- memosJson: ventana rolling de 14 días de memos
- wikiVersion: entero autoincremental “este análisis usó la versión 12 del wiki”
Hora 2 Write path (registrar sesiones)
Hookeé el logger en dos lugares:
- POST /api/payments/[id]/analyze cada análisis de fraude escribe su sesión automáticamente
- PUT /api/payments/[id] cuando un operador aprueba o rechaza, el sistema detecta si fue una corrección (humano en desacuerdo con la IA) y la registra como señal de alta prioridad
Hora 3 Nightly synthesis job
Una función que corre a las 01:30 AM hora Ecuador:

El prompt le pide explícitamente al LLM que considere el contexto ecuatoriano: nombres de bancos, formatos de comprobantes, tipos de comerciante. No es un memo genérico es conocimiento específico del dominio.
Costo del LLM call: ~$0.006/noche con Gemini Flash.
Hora 4 Read path (inyección de contexto)
Antes de cada análisis de fraude, el sistema recupera el wiki del fraud_detector y lo prepende al system prompt:

El agente ahora sabe lo que aprendió ayer antes de ver el comprobante de hoy.
Hora 5 Dashboard admin + seed data
Un dashboard en /admin/brain con KPIs en tiempo real, comparación benchmark con/sin Brain, visor expandible del wiki y botón de síntesis manual. Más 16 sesiones seed con casos reales (fraudes documentados en nuestro paper de investigación) para que el primer wiki ya tuviera señal útil.

Comparación de costos: lo que hubiera costado

Fuentes: pricing verificado junio 2026 en sitios oficiales de cada producto
La diferencia no es solo de precio. Es de propiedad: el Brain que construí es white-labelable para el deal enterprise que estoy cerrando con una aseguradora. Un sistema Mem0 o Zep no me pertenece; este sí.
Qué mejora en tu producto cuando tienes memoria agéntica
Este es el punto que creo que más se subestima al hablar de estos sistemas:
La memoria no hace que el agente sea más inteligente. Lo hace más relevante.
Un agente sin memoria es un consultor que llega a cada reunión sin haber leído los emails anteriores. Técnicamente capaz, contextualmente ciego.

Con memoria agéntica auto-mejorable:
- Reduce falsos positivos el agente recuerda que cierto formato de cooperativa genera alarma por razones técnicas (no fraude real) y ajusta su umbral
- Aprende de las correcciones humanas sin reentrenamiento cada override de un operador se convierte en una regla nueva en el wiki overnight, sin tocar el modelo base
- Personaliza por dominio un wiki para fraud_detector, otro para sales_agent, otro para cobros. Cada uno aprende de sus propios datos, no de los de los otros
- Construye un moat defensible después de 6 meses de operación, tu wiki tiene patrones específicos de Ecuador que ningún competidor que empiece hoy puede replicar en semanas
El +25% de precisión que reporta Perplexity Brain no viene del modelo, viene de no empezar desde cero cada vez.
El factor humano
La corrección humana siempre gana, pero no “anula” enseña
El sistema no prioriza una señal sobre otra en tiempo real como un sistema de reglas con pesos. En su lugar, opera en dos tiempos:
Tiempo real (análisis):
- Las reglas (OCR, metadatos EXIF, artefactos JPEG, coherencia semántica, señales conversacionales) producen un
riskScore+ señales + veredicto recomendado - Pero el sistema nunca rechaza automáticamente — es Human-in-the-Loop por diseño. El veredicto llega al operador humano como insumo, no como decisión final
- Si el operador anula la decisión, el campo
humanCorrectionregistra el texto exacto de la razón (no solo "safe"/"fraud")
Tiempo diferido (síntesis nocturna):
- El campo
humanCorrectiones tratado como la señal de mayor valor (sección 6.2 del paper) - Un
outcome: failedcon corrección tipo "el comprobante es de Cooperativa Atuntaqui, no de JEP — el formato es diferente" genera una calibración mucho más específica que un simpleoutcome: success - La síntesis nocturna (Gemini Flash, 01:30 AM ECT) procesa estos casos y actualiza el wiki con
PATTERNS_THAT_FAILEDyCALIBRATION_UPDATES - La próxima vez que el detector analice un caso similar, el wiki inyectado ya contiene esa corrección
No hay capa de pesos — hay aprendizaje por síntesis
La diferencia clave con un sistema de pesos tradicional: no hay un número que diga “regla X tiene peso 0.7, feedback humano 0.9”. Lo que hay es un wiki en lenguaje natural que el LLM consume como contexto. Cuando hay conflicto entre lo que las reglas detectan y lo que el operador dice, el wiki lo resuelve semánticamente — por ejemplo:
“Comprobantes de Cooperativa Atuntaqui usan formato similar a JEP pero con logo diferente. No clasificar como duplicado si la institución difiere.”
Eso no es un peso numérico — es una calibración contextual que el modelo aplica en inferencia.
Protecciones contra ruido humano
El paper reconoce en la sección 8.1 que operadores inconsistentes pueden introducir ruido. Las protecciones son:
- Ventana rolling de 14 días — el wiki se auto-depura descartando memos antiguos
- Spot-check post-síntesis — 3 fraudes conocidos + 3 limpios conocidos se re-evalúan con cada wiki nuevo. Si la precisión cae debajo del 80%, se activa alerta
**wikiVersiontracking** — permite correlacionar qué versión del wiki causó regresiones y revertir
En resumen: las reglas proponen, el humano dispone, y la síntesis nocturna convierte ese feedback en conocimiento reutilizable. No hay conflicto — hay ciclo de aprendizaje.
Lo que sigue
El sistema está corriendo en dev.ainstantly.ai. En las próximas semanas:
- Medir el benchmark real hadBrainContext = true vs false sobre las primeras 200 sesiones de producción
- Extender a sales_agent el mismo pipeline para el agente de recuperación de carritos abandonados (“Recupera clientes que te dejaron en visto”)
- Open source del patrón publicar la arquitectura base como módulo reutilizable bajo el proyecto ainstantly.ai/detecciondeestafas
Para el Forward Deploy Designer
El título de este post no es accidental. “Forward Deploy Designer” no significa que diseñas interfaces significa que llegas al problema antes que el equipo de ingeniería, construyes el prototipo funcional, y defines el estándar que el equipo después escala.
Esto es exactamente lo que pasó aquí:
- Leí el paper de Perplexity Brain el día que salió
- Identifiqué el patrón arquitectónico relevante para mi producto
- Lo implementé en 5 horas usando las herramientas que ya tenía
- Ahora tengo un asset demostrable antes de que ningún competidor regional lo haya considerado
No necesité un equipo de ML. No necesité $200/mes. Necesité entender el patrón y saber conectar las piezas.
Ese es el trabajo del Forward Deploy Designer en 2026: ver la investigación, traducirla en producto, moverla a producción.
¿Estás construyendo sistemas de memoria para tus agentes? ¿Qué arquitectura estás usando y cuál es tu costo operativo real? Comenta abajo me interesa comparar notas.
Sigo el progreso de AInstantly en
. El paper técnico sobre fraude por transferencias en Ecuador está en
메타데이터
- post_id
- e4df7284b7fc
- slug
- perplexity-brain-pero-hecho-casa-e4df7284b7fc
- url
- https://medium.com/@javieralcivar/perplexity-brain-pero-hecho-casa-e4df7284b7fc
- canonical_url
- https://medium.com/@javieralcivar/perplexity-brain-pero-hecho-casa-e4df7284b7fc
- author_url
- https://medium.com/@javieralcivar
- status
- ok
- fetched_at
- 2026-06-21 09:28:28