About Me

I'm a PhD student at Tsinghua University, working on vision-language models, generalist agents, and image generation. You can find my full publication list on Google Scholar. citations5594 Updated

🔥 News

  • 2026.09:   WeVisDoc was released with open-source code and 2B/4B models for robust end-to-end document parsing.
  • 2026.08:   PaDoc was released with open-source code and model weights.
  • 2026.08:   🎉 OmniAlpha has been accepted to ACM Multimedia 2026 as an Oral Presentation!
  • 2025.11:   OmniAlpha was released with open-source code and model weights.
  • 2025.07:   AlphaVAE was released with open-source code, data, and models.

📝 Publications

ACM MM 2026 (Oral)
OmniAlpha examples of transparent image generation, matting, and layer decomposition.

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

Hao Yu*, Jinglin Wang*, Jiabo Zhan*, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

Unifies RGBA generation and editing in one model, using layer-aware rewards to improve transparency and composition.

BibTeX for OmniAlpha
Download .bib
@misc{omnialpha25,
  title = {{OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning}},
  author = {Hao Yu and Jinglin Wang and Jiabo Zhan and Rui Chen and Zile Wang and Huaisong Zhang and Hongyu Li and Xinrui Chen and Yongxian Wei and Chun Yuan},
  year = {2025},
  eprint = {2511.20211},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2511.20211}
}
ICLR 2024
Overview of the eight interactive environments used to evaluate language agents in AgentBench.

AgentBench: Evaluating LLMs as Agents

Xiao Liu*, Hao Yu*, Hanchen Zhang*, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

Evaluates language agents across eight interactive environments, revealing gaps in reasoning, decision-making, and instruction following.

BibTeX for AgentBench
Download .bib
@misc{agentbench23,
  title = {{AgentBench: Evaluating LLMs as Agents}},
  author = {Xiao Liu and Hao Yu and Hanchen Zhang and Yifan Xu and Xuanyu Lei and Hanyu Lai and Yu Gu and Hangliang Ding and Kaiwen Men and Kejuan Yang and Shudan Zhang and Xiang Deng and Aohan Zeng and Zhengxiao Du and Chenhui Zhang and Sheng Shen and Tianjun Zhang and Yu Su and Huan Sun and Minlie Huang and Yuxiao Dong and Jie Tang},
  year = {2023},
  eprint = {2308.03688},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2308.03688}
}
ICLR 2026
GeoPerceive and GeoDPO pipelines for generating geometric data, training the translator, and optimizing the vision-language model.

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

Hao Yu, Shuning Jia, Guanghao Li, Wenhao Jiang, Chun Yuan

Isolates geometric perception from reasoning, then improves diagram understanding with translator-guided reinforcement learning.

BibTeX for GeoPerceive
Download .bib
@misc{geoperceive26,
  title = {{Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning}},
  author = {Hao Yu and Shuning Jia and Guanghao Li and Wenhao Jiang and Chun Yuan},
  year = {2026},
  eprint = {2602.22703},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2602.22703}
}
CVPR 2025
ComRoPE encodes spatial positions using trainable rotations in feature space.

ComRoPE: Scalable and Robust Rotary Position Embedding Parameterized by Trainable Commuting Angle Matrices

Hao Yu, Tangyu Jiang, Shuning Jia, Shannan Yan, Shunning Liu, Haolong Qian, Guanghao Li, Shuting Dong, Huaisong Zhang, Chun Yuan

Generalizes rotary position embeddings with trainable commuting matrices for more flexible encoding and stronger resolution generalization.

BibTeX for ComRoPE
Download .bib
@misc{comrope25,
  title = {{ComRoPE: Scalable and Robust Rotary Position Embedding Parameterized by Trainable Commuting Angle Matrices}},
  author = {Hao Yu and Tangyu Jiang and Shuning Jia and Shannan Yan and Shunning Liu and Haolong Qian and Guanghao Li and Shuting Dong and Huaisong Zhang and Chun Yuan},
  year = {2025},
  eprint = {2506.03737},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2506.03737}
}

📄 Technical Reports

💻 Internship

  • 2026.04 – Present, Tencent, WXG · 青云计划 (Qingyun Program)
  • 2025.06 – 2026.04, ByteDance, Seed Team
  • 2023.02 – 2024.07, Zhipu AI, GLM Team