M 3 GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
–Neural Information Processing Systems
M 3 GPT operates on three fundamental principles. The first focuses on creating a unified representation space for various motion-relevant modalities. We employ discrete vector quantization for multimodal conditional signals, such as text, music and motion/dance, enabling seamless integration into a large language model (LLM) with a single vocabulary.The second involves modeling motion generation directly in the raw motion space. This strategy circumvents the information loss associated with a discrete tokenizer, resulting in more detailed and comprehensive motion generation. Third, M 3 GPT learns to model the connections and synergies among various motion-relevant tasks.
Neural Information Processing Systems
May-26-2025, 20:37:45 GMT
- Technology: