<!DOCTYPE html>

Zhengrong Yue | Multimodal Models, Agents & Embodied AI

Multimodal intelligence · Agents · Embodied AI

Zhengrong Yue (岳政融)

PhD Student
Shanghai Jiao Tong University & Shanghai AI Lab

Zhengrong Yue

I am a PhD student at Shanghai Jiao Tong University and Shanghai AI Lab, advised by Prof. Yali Wang. I received my bachelor’s degree in Computer Science and Technology from China University of Mining & Technology (Beijing) in 2024.

I have previously held research internships at Meituan, Alibaba, Huawei, Samsung, Shanghai AI Lab, and SIAT.

  • Unified Multimodal Understanding & Generation
  • LLM Agents
  • Embodied AI & World Models
  • Quantitative Research

I expect to graduate in 2029 and am actively seeking internship opportunities in unified multimodal understanding and generation, LLM agents, and embodied AI / world models. Please email me to discuss internships or potential research collaborations.

Publications

* Equal contribution · Full publication list

2026

Preprint 2026

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

Preprint 2026

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

Haodong Li, Tianfei Ren, ..., Zhengrong Yue, Yaxin Luo, Xiaotong Li et al.

NeurIPS 2026

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang.

NeurIPS 2026

Continuous-Time Distribution Matching for Few-Step Diffusion Distillation

Tao Liu, Hao Yan, Mengting Chen, Taihang Hu, Zhengrong Yue, Zihao Pan, Jinsong Lan, Xiaoyong Zhu, Ming-Ming Cheng, Bo Zheng, Yaxing Wang.

ECCV 2026

Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing

Zhentao Zou*, Zhengrong Yue*, Kunpeng Du, Binlei Bao, Hanting Li, Haizhen Xie, Guozheng Xu, Yue Zhou, Yali Wang, Jie Hu, Xue Jiang, Xinghao Chen.

CVPR 2026

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

Boyu Chen*, Zikang Wang*, Zhengrong Yue*, Kainan Yan*, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang.

ICLR 2026

UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation

Zhengrong Yue, Haiyu Zhang, Xiangyu Zeng, Boyu Chen, Chenting Wang, Shaobin Zhuang, Lu Dong, Kunpeng Du, Yi Wang, Limin Wang, Yali Wang.

AAAI 2026 (Oral)

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

Zikang Wang*, Boyu Chen*, Zhengrong Yue*, Yi Wang, Yu Qiao, Limin Wang, Yali Wang.

AAAI 2026

G-UBS: Towards Robust Understanding of Implicit Feedback via Group-Aware User Behavior Simulation

Boyu Chen*, Siran Chen*, Zhengrong Yue*, Kainan Yan, Chenyun Yu, Beibei Kong, Cheng lei, Chengxiang Zhuo, Zang Li, Yali Wang.

2025

NeurIPS 2025

VTTS: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception

Ziang Yan*, Yinan He*, Xinhao Li*, Zhengrong Yue*, Xiangyu Zeng, Yali Wang, Yu Qiao, Limin Wang, Yi Wang.

ICCV 2025

LVAgent: Dynamic Round-by-round MLLM Agent Collaboration for Long Video Understanding

Boyu Chen*, Zhengrong Yue*, Siran Chen*, Zikang Wang, Yang Liu, Peng Li, Yali Wang.

CVPR 2025

V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents

Zhengrong Yue, Shaobin Zhuang, Kunchang Li, Yanbo Ding, Yali Wang.

ICLR 2025

TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning

Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, Yali Wang, Yu Qiao, Limin Wang.

AAAI 2025

Muses: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration

Yanbo Ding, Shaobin Zhuang, Kunchang Li, Zhengrong Yue, Yu Qiao, Yali Wang.

Research experience

Dates indicate the start of each internship.

Jun 2026

Meituan

BeiDou Talent Plan · LongCat M17 · Research Intern

Unified MLLMs; coding agents for multimodal tasks; world action models.

Dec 2025

Alibaba

T-Star Talent Plan · Taotian · Research Intern

Representation tokenizers for latent diffusion; unified reward models for generation and editing.

Jul 2025

Huawei

Noah’s Ark Lab · Research Intern

Text–image interwoven reasoning for image editing; unified multimodal models.

Jul 2024

Shanghai AI Lab

OpenGVLab · Research Intern

Unified tokenizers; multimodal video understanding and generation.

Nov 2023

SIAT

Multimedia Lab · Research Intern

Video style editing with MLLM agents.

Sep 2023

Samsung

Language Understanding Lab · Research Intern

Multilingual document question answering with RAG for Galaxy Z Fold.

Education

2024 – Present

Shanghai Jiao Tong University & Shanghai AI Lab

PhD · Advised by Prof. Yali Wang

2020 – 2024

China University of Mining & Technology (Beijing)

Bachelor of Computer Science and Technology

GPA 3.9/4.0 · Outstanding Graduate of Beijing

Honors & awards

Academic service

Conference reviewer
CVPR 2026 · ECCV 2026 · ICML 2026 · NeurIPS 2026 · ICLR 2027

Journal reviewer
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

WeChat

WeChat QR code for Zhengrong Yue (Amo_Yuezr)

Scan with WeChat to connect.