Vision-Language (CLIP/LLaVA/Qwen-VL), cross-attention multimodal projectors, Diffusion Transformers (DiT) for video, and native full-duplex speech models.
ViT visual encoders (SigLIP/CLIP), cross-attention multimodal projection layers, visual instruction tuning (LLaVA/Qwen-VL), dynamic high-res image patch splitting, and MMBench evaluation.
Diffusion Transformers (DiT), Flow Matching, 3D spatiotemporal VAE compression, native end-to-end full-duplex speech-to-speech models, and generated media provenance watermarking.