Light-MER: Lightweight Multimodal Emotion Recognition

A sub-1B parameter multimodal emotion recognition model that processes video, audio, and text to recognize emotions. Upload a video, optional audio, and optional subtitle/context text.

Examples use full audio-visual speech clips from RAVDESS with transcript text.

64 1024
0.1 2
0.1 1
Examples
Video Input (sampled frames) Subtitle / Context (optional) Question