MMoTEMixture of Task Experts
Pass 1 · observing video
InputVideo + natural-language prompt
Expert SelectionPrompt-conditioned routing via cosine similarity
P

Waiting for completed prompt

E1Current Action Prediction
E2Activity Classification
E3Next Step Prediction
E4Feedback Generation
Video ProcessorSampled frames → visual tokens
Visual
Encoder
frozen
MLP
Projector
trainable
EXPERT ID
INPUT TOKENS
PROMPTVISUAL
Routing in VideoLLM-MoTE
MODEL RESPONSE