Research

Audiovisual Modeling: I develop audiovisual models for human communication and interaction, exploring diffusion models to integrate speech and visual modalities — enhancing both the understanding of human interactions and the generation of natural facial expressions and body motions.

Multimodal Language Model: This line of research focuses on language models that integrate text, speech, and visual signals to advance multimodal understanding and generation. My work explores modality fusion approaches and multi-task training at scale, enabling capabilities such as spoken dialogue generation and cross-modal translation.

Cross-modal Translation: This research addresses core challenges in translation across speech and text modalities, focusing on multilingual data mining, massive multilinguality, and multi-task training.

Multilingual Modeling: This research focuses on building adaptive model architectures, robust representations, and scalable training recipes across diverse languages and domains.