TRIBE v2 Brain Encoding Model
Skill by ara.so — Daily 2026 Skills collection
TRIBE v2 is Meta's multimodal foundation model that predicts fMRI brain responses to naturalistic stimuli (video, audio, text). It combines LLaMA 3.2 (text), V-JEPA2 (video), and Wav2Vec-BERT (audio) encoders into a unified Transformer architecture that maps multimodal representations onto the cortical surface (fsaverage5, ~20k vertices).
Installation
Quick Start — Inference
Load pretrained model and predict from video
Multimodal input — video + audio + text
Text-only prediction
Brain Visualization
Training a Model from Scratch
1. Set environment variables
2. Authenticate with HuggingFace (required for LLaMA 3.2)
3. Local test run
4. Full grid search on Slurm
Key API — TribeModel
Project Structure
Configuration — Defaults
Edit tribev2/grids/defaults.py or set environment variables:
Custom Experiment with PyTorch Lightning
Working with fMRI Surfaces
Common Patterns
Batch prediction over multiple videos
Extract predictions for specific brain region
Access segment timing metadata
Troubleshooting
LLaMA 3.2 access denied
CUDA out of memory during inference
Missing visualization dependencies
Slurm training not submitting
Video without audio track causes error

