Introduction

Brian (Bo) Li is a member of technical staff at Advanced Machine Intelligence. His research focuses on multimodal models and building artificial intelligence systems.

He started LMMs-Lab with Prof. Ziwei Liu, a non-profit open-source community advancing multimodal AI through fully open models, data, and tools. Since 2024, they have made significant contributions to the field, including LLaVA-OneVision (performance matching commercial models, fully open), OneVision-Encoder (codec-aligned vision encoder), LMMs-Eval (unified multimodal evaluation infrastructure), LMMs-Engine (unified multimodal models training infrastructure), and Multimodal-SAE (safety and interpretability research).

Beyond research, he occasionally writes science fiction exploring AI consciousness and the nature of understanding:

- [Selected publications](#selected-publications) - [Professional experience](#professional-experience) - [Professional services](#professional-services) - [Talks and lectures](#talks-and-lectures) - [Administrative roles](#administrative-roles) - [Peer review](#peer-review)

Selected publications

  1. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence arXiv 2026 Code Codec-stream tokenization for video understanding, temporal and spatial grounding, and manipulation-trace reasoning. Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng
  2. OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence arXiv 2026 Code Learning visual representations from sparse, informative video patches with shared spatial and temporal coordinates. Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng
  3. LMMs Engine for Unified Multimodal Training Open-source Project A simple, unified multimodal training engine, now with distributed recipes for vision-language models and video generation. Lead codebase design and core maintainer
  4. LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training arXiv 2025 Code A reproducible framework for training open vision-language models, including data curation and reinforcement learning post-training. Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li*, Jiankang Deng
  5. Aero-1-Audio Technical Blog Open models for wide range of audio tasks, trained on only 50K hours data yet achieving excellent performance, suggesting smart data > massive training; Lead development Bo Li*, Chen Change Loy, Fanyi Pu, Jingkang Yang, Kaichen Zhang*, Kairui Hu, Luu Minh Thang*, Nguyen Quang Trung*, Pham Ba Cong*, Shuai Liu, Yezhen Wang*, Ziwei Liu
  6. LLaVA-OneVision: Easy Visual Task Transfer TMLR 2025 SOTA-level fully open models (models/data/code) achieving GPT-4o-level performance across 30+ image and video tasks. Lead codebase, data curation, and evaluation Bo Li*, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, Chunyuan Li
  7. LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models Findings of NAACL 2025 Open-source evaluation across text, image, video, and audio, now with an HTTP evaluation service, statistical comparisons, and agentic tasks; contributed core framework and major code Kaichen Zhang*, Bo Li*, Peiyuan Zhang*, Fanyi Pu*, Joshua Adrian Cahyono*, Kairui Hu*, Shuai Liu*, Yuanhan Zhang*, Jingkang Yang*, Chunyuan Li*, Ziwei Liu*
  8. LLaVA-NeXT: Improved reasoning, OCR, and world knowledge Technical Blog Code First open models achieving GPT-4V-level performance, trained for 24 hours on 32 A100 GPUs. Proposed the idea that massive evaluation leads to better models Haotian Liu, Chunyuan Li, Yuheng Li, Bo Li, Yuanhan Zhang, Sheng Shen, Yong Jae Lee
  9. MIMIC-IT: Multi-modal In-Context Instruction Tuning TPAMI 2025 Code Early (2023-10) experiment on a vision-language-agent (VLA) model with RLHF; proposed the idea and drafted the training code Bo Li*, Yuanhan Zhang*, Liangyu Chen, Jinghao Wang, Fanyi Pu, Jingkang Yang, Chunyuan Li, Ziwei Liu
  10. Benchmarking and Analyzing Generative Data for Visual Recognition TPAMI 2025 Code Early (2022-12) experiment using synthetic data for visual recognition Bo Li, Haotian Liu, Liangyu Chen, Yong Jae Lee, Chunyuan Li, Ziwei Liu
  11. Coordinating Multiple Vision-Language Models for Visual Reasoning NeurIPS 2023 Liangyu Chen*, Bo Li*, Sheng Shen, Jingkang Yang, Chunyuan Li, Kurt Keutzer, Trevor Darrell, Ziwei Liu
  12. Sparse Mixture-of-Experts are Domain Generalizable Learners ICLR 2023 (Oral) Code First batch (2022-05) theoretical analysis of the mixture-of-experts architecture from a generalization perspective Bo Li*, Yifei Shen*, Jingkang Yang, Yezhen Wang, Jiawei Ren, Tong Che, Jun Zhang, Ziwei Liu
  13. Invariant information bottleneck for domain generalization AAAI 2022 Code Bo Li, Yifei Shen, Yezhen Wang, Wenzhen Zhu, Dongsheng Li, Kurt Keutzer, Han Zhao
  14. Energy-Based Open-World Uncertainty Modeling for Confidence Calibration ICCV 2021 Code Yezhen Wang, Bo Li, Tong Che, Kaiyang Zhou, Ziwei Liu, Dongsheng Li
  15. Learning invariant representations and risks for semi-supervised domain adaptation CVPR 2021 Code Bo Li, Yezhen Wang, Shanghang Zhang, Dongsheng Li, Kurt Keutzer, Trevor Darrell, Han Zhao
  16. MADAN: multi-source adversarial domain aggregation network for domain adaptation IJCV 2021 Sicheng Zhao, Bo Li, Pengfei Xu, Xiangyu Yue, Guiguang Ding, Kurt Keutzer
  17. Rethinking distributional matching based domain adaptation arXiv preprint arXiv:2006.13352 Bo Li, Yezhen Wang, Tong Che, Shanghang Zhang, Yoshua Bengio, Kurt Keutzer
  18. Multi-source domain adaptation for semantic segmentation NeurIPS 2019 Code Sicheng Zhao*, Bo Li*, Xiangyu Yue*, Yang Gu, Pengfei Xu, Runbo Hu, Hua Chai, Kurt Keutzer

Professional experience

Professional services

Talks and lectures

  • Multimodal Models @ Jump Trading (2025), hosted by Weifeng Liu
  • Guest Lecture: Multimodal Models @ UMich EECS 542, hosted by Stella X. Yu
  • Multimodal Models @ TwelveLabs (2024), hosted by James Le
  • Otter & MIMICIT @ Alibaba Damo Academy (2023), hosted by Dr. Lidong Bing

Administrative roles

Peer review

Conferences: ICCV (2021, 2023), NeurIPS (2022), BMVC (2023), AAAI (2023), CVPR (2022, 2023), AISTATS (2023), ICML (2023)

Journals: Pattern Recognition (PR), IEEE Transactions on Multimedia (TMM), IEEE TPAMI, IJCV


This page is styled after Wikipedia.