Ziyang Pan

I am a researcher working on foundation models and agents. I am currently affiliated with z.ai (Zhipu AI), contributing to the GLM series of foundation models. I have been a member of GLM team since 2023, supervised by Prof. Jie Tang at Tsinghua University. Before that, I received my Bachelor's and Master's degrees at Sun Yat-sen University, under the supervision of Prof. Daifeng Li.

My research interests include foundation models, agents, and physical intelligence.

Email  /  Scholar  /  Github

profile photo

Publications

Visual Language Foundation Models

GLM-5V-Turbo
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
Core Contributor, authors listed in reverse alphabetical order.
Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue Wang, Yuanchang Yue, Yu Wang, Yanling Wang, Yan Wang, Xijun Liu, Wenmeng Yu, Weihan Wang, Wei Li, Shuaiqi Duan, Sheng Yang, Ruiliang Lv, Mingdao Liu, Lihang Pan, Ke Ning, Junhui Ji, Jinjiang Wang, Jing Chen, Jiazheng Xu, Jiale Zhu, Jiale Cheng, Ji Qi, Guobing Gan, Guo Wang, Cong Yao, Zijun Dou, Zihao Zhou, Zihan Wang, Zhiqi Ge, Zhijie Li, Zhenyu Hou, Zhao Xue, Zehui Wang, Zehai He, Yusen Liu, Yukuo Cen, Yuchen Li, Yuan Wang, Yijian Lu, Yanzi Wang, Yadong Xue, Xinyu Zhang, Xinyu Liu, Wenkai Li, Tianyu Tong, Tianshu Zhang, Shengdong Yan, Qinkai Zheng, Mingde Xu, Licheng Bao, Jiaxing Xu, Jiaxin Fan, Jiawen Qian, Jiali Chen, Jiahui Lin, Haozhi Zheng, Haoran Wang, Haochen Li, Fan Yang, Dan Zhang, Chuangxin Zhao, Chengcheng Wu, Boyan Shi, Bowei Jia, Baoxu Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang.

ArXiv / Blog / API / bibtex

A foundation model that natively unifies visual perception with reasoning, planning, and tool use for multimodal agents. Excels in visual coding and framework-based agent operations while maintaining strong text-based coding capability.

Framework of GLM-4.5V and GLM-4.1V-Thinking
GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
Core Contributor, authors listed in alphabetical order.
Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Jiazheng Xu, Jiale Zhu, Jiali Chen, Jing Chen, Jinhao Chen, Jinghao Lin, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Sheng Yang, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Shangqin Tu, Shengbiao Meng, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wenkai Li, Wei Jia, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyue Fan, Xuancheng Huang, Yanling Wang, Yadong Xue, Yanfeng Wang, Yanzi Wang, Yifan An, Yifan Du, Yiming Shi, Yiheng Huang, Yilin Niu, Yuan Wang, Yuanchang Yue, Yuchen Li, Yutao Zhang, Yuting Wang, Yu Wang, Yuxuan Zhang, Zhao Xue, Zhenyu Hou, Zhengxiao Du, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang.

ArXiv / GitHub / Models 4.1V & 4.5V / API 4.1V (free) & 4.5V / bibtex

A family of vision-language models supporting both thinking and non-thinking modes, trained with Reinforcement Learning with Curriculum Sampling (RLCS). Achieves state-of-the-art performance among comparably sized open-source VLMs across STEM, video, GUI, and document understanding tasks.

Foundation Model Evaluation

Vision2Web
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang
ICML, 2026 (Spotlight)
arXiv / project page / code / bibtex

A hierarchical benchmark spanning static UI-to-code, interactive multi-page reproduction, and long-horizon full-stack development. Comprises 193 tasks across 16 categories with 918 prototype images and 1,255 test cases, evaluated through a workflow-based agent verification paradigm.

Information Science

Robust Neural Rankers
Towards Robust Neural Rankers with Large Language Model: A Contrastive Training Approach
Ziyang Pan, Kangjia Fan, Rongyu Liu, Daifeng Li
Applied Sciences, vol. 13, no. 18, art. 10148, 2023
paper / bibtex

Uses LLM-generated intent-preserving query variations to drive a contrastive training framework that substantially improves the robustness of neural IR rankers against query perturbations while preserving retrieval performance.

UDM Sales Forecasting
A Universality–Distinction Mechanism-Based Multi-Step Sales Forecasting for Sales Prediction and Inventory Optimization
Daifeng Li, Xin Li, Fengyun Gu, Ziyang Pan, Dingquan Chen, Andrew Madden
Systems, vol. 11, no. 6, art. 311, 2023
paper / bibtex

A multi-step sales forecasting framework that disentangles universal sequence patterns from instance-specific fluctuations, with a query-sparsity-measurement attention to scale to large multivariate time series for inventory optimization.

MS-LSTM Marketing Prediction
Multi-data Fusion Based Marketing Prediction of Listed Enterprise Using MS-LSTM Model
Ziyang Pan, Zhibo Huang, Xiaowen Lin, Shang Li, Hao Zeng, Daifeng Li
Proceedings of the 2020 3rd International Conference on Algorithms, Computing and Artificial Intelligence (ACAI), 2020
paper / bibtex

A Multi-Sequence LSTM (MS-LSTM) model fusing heterogeneous data sources for marketing prediction of publicly-listed enterprises.


Template adapted from Jon Barron's website.