MODALTERNA. Tecnología & Negocios. Meta abre el código de TRIBE v2: un modelo de IA que simula la respuesta cerebral ante videos comerciales
La división científica Meta FAIR publica un sistema entrenado con 720 cerebros en resonancia magnética funcional. La herramienta predice segundo a segundo la actividad cortical y arroja datos clave sobre por qué el usuario descarta un contenido al primer instante.
Fuentes documentales verificadas: Meta FAIR (Fundamental AI Research), certamen Algonauts 2025 y repositorios oficiales de código abierto.
Quien invierte presupuesto en pauta digital conoce de cerca la incertidumbre habitual de las pruebas: producir campañas en video, publicarlas y descubrir a las pocas horas que una fracción importante de los usuarios deslizó la pantalla en los primeros compases. Comprender con precisión técnica qué elemento falló suele ser un proceso empírico de ensayo y error.
Hasta ahora, medir la respuesta biológica de una persona ante un estímulo audiovisual requería trasladar voluntarios a centros de investigación, costear horas de máquina en escáneres de resonancia magnética funcional (fMRI) y trabajar con muestras reducidas de 30 o 40 participantes.
Esa barrera de costes y escala acaba de transformarse.
La división de investigación fundamental de Meta (FAIR) hizo público el código y los pesos de TRIBE v2 (TRImodal Brain Encoder). No se trata de un generador de textos ni de una función automatizada para redes sociales. Es un modelo de simulación neurobiológica que toma un video, su pista de sonido y su texto, y calcula segundo a segundo cómo reaccionaría la corteza cerebral humana frente a esos estímulos, sin necesidad de someter a personas a escaneos continuos.
La base empírica: 1.117 horas de registros clínicos reales
TRIBE v2 fue construido sobre datos neurobiológicos directos y contrastables:
- Muestra de 720 voluntarios: El equipo de investigación integró más de 1.100 horas de registros de resonancia magnética funcional (fMRI) de cientos de individuos sanos mientras consumían contenidos cotidianos: secuencias de cine, series comerciales, podcasts y piezas de redes sociales.
- Procesamiento trimodal simultáneo: El modelo descompone el material mediante tres sistemas especializados: V-JEPA 2 para la imagen y el movimiento, Wav2Vec-BERT para la acústica y la voz, y LLaMA 3.2 para la semántica del lenguaje.
- Resolución anatómica de 70.000 vóxeles: Una capa neuronal proyecta la actividad sobre unos 70.000 puntos tridimensionales del cerebro, logrando una resolución espacial setenta veces superior a la de versiones previas. El desarrollo obtuvo el primer lugar mundial en el certamen de neurociencia computacional Algonauts 2025 frente a más de 260 equipos internacionales.
«TRIBE v2 actúa como un gemelo digital de la actividad neuronal humana. Ofrece una velocidad sin precedentes y un aumento de resolución de 70 veces para predecir cómo responde el cerebro a casi cualquier imagen o sonido, permitiendo poner a prueba hipótesis sin requerir sujetos humanos en cada experimento.»
— Declaración del equipo de investigación de Meta FAIR.
Lo que revelan los datos para la creación de contenido: la economía cognitiva
Más allá del avance académico, los registros de laboratorio aportan conclusiones objetivas para directores creativos, comerciantes y realizadores:
- La reacción al descarte es preconsciente: El reflejo de deslizar la pantalla (scroll) ocurre en fracciones de segundo, en una fase de procesamiento perceptivo previa a la deliberación reflexiva.
- La saturación produce fatiga: El cerebro humano prioriza la conservación de energía metabólica. Cuando un video sobrecarga la pantalla con estímulos descoordinados —cortes abruptos desordenados, textos titilantes en exceso y disonancia auditiva—, la memoria de trabajo se congestiona y el sistema nervioso tiende a evitar el esfuerzo continuado.
- Claridad sobre estridencia: Los registros confirman que las piezas con mayor retención facilitan una decodificación sensorial fluida. La efectividad de los primeros segundos no radica en elevar el volumen de los estímulos, sino en presentar la propuesta visual y auditiva con orden y limpieza.
Precisiones técnicas y límites legales indispensables
Para informar con rigor y evitar expectativas distorsionadas en el sector comercial, es fundamental delimitar el alcance real de la herramienta:
- No es una función integrada en Meta Ads: Meta publicó el modelo bajo licencia Creative Commons No Comercial (CC BY-NC 4.0), orientada estrictamente a la investigación científica. No existe ningún botón dentro de Facebook, Instagram o el Administrador de Anuncios que aplique este análisis en automático. Su uso requiere que equipos técnicos descarguen los repositorios de GitHub y ejecuten el modelo en servidores propios con tarjetas gráficas de alto rendimiento.
- Mide flujos sanguíneos, no pensamientos: La fMRI registra la señal BOLD (el consumo de oxígeno en la sangre al activarse las neuronas), sujeta a un retraso fisiológico natural de varios segundos. Científicos y especialistas subrayan que TRIBE v2 es un modelo de codificación perceptual: no lee pensamientos, no registra opiniones privadas ni predice decisiones de compra.
- Representa a un observador estándar: La simulación refleja el promedio de adultos sanos en reposo dentro de un entorno controlado. No sustituye el análisis de mercado local, los modismos de una región ni la competitividad de un precio. Si la propuesta comercial carece de interés, ninguna optimización biológica garantiza resultados de venta.
El debate de fondo para las marcas
La posibilidad de simular respuestas cerebrales plantea una disyuntiva estratégica: si las agencias y empresas optimizan sus producciones audiovisuales guiadas exclusivamente por evitar el menor esfuerzo cognitivo del espectador, la comunicación corre el riesgo de caer en una estética homogénea y predecible.
En sectores donde la identidad es determinante —como la moda, el diseño o la gastronomía—, el valor de una marca se construye sobre la originalidad, el contraste y el criterio propio. TRIBE v2 entrega un mapa empírico para identificar puntos de confusión innecesaria; corresponde al criterio de cada creador y empresario decidir si utilizará este recurso para comunicar con mayor claridad sin perder la autenticidad visual que lo distingue en el mercado.
Ficha de verificación y fuentes oficiales:
- Desarrollo: Meta FAIR (Fundamental AI Research).
- Publicación científica: «A foundation model of vision, audition, and language for in-silico neuroscience» (Meta FAIR, marzo de 2026).
- Competición de referencia: Primer lugar general en el Algonauts Project 2025 Challenge.
- Base de entrenamiento: Más de 1.100 horas de fMRI sobre 720 voluntarios sanos.
- Licencia y acceso: Código abierto para investigación (Creative Commons BY-NC 4.0) alojado en los repositorios de Meta Research en GitHub y Hugging Face.


0 Comments