国奖琅琊榜---许刚伟

Author:Time:2026-09-21Hits:



许刚伟个人风采介绍



一、研究方向与总体成果

本人系华中科技大学电信学院博士研究生,师从杨欣教授,预计2027年6月毕业,研究方向为物理人工智能(Physical AI)与世界模型。攻读学位期间,以第一作者身份在T-PAMI、NeurIPS、CVPR、ICCV等国际顶级期刊与会议发表论文12篇,第一作者论文在谷歌学术累计被引超过1800次,相关方法被国内外同行广泛复现与使用。

二、本年度重点工作:世界模型与具身智能

本年度聚焦具身智能与世界模型这一国际前沿方向,取得系列进展。作为第一作者提出Next Forcing多块预测框架:针对自回归视频世界模型中“短视监督”导致模型倾向于学习局部外观捷径、难以刻画长程物理动态的关键瓶颈,设计轻量级多块预测模块,通过因果链对多个未来视频块施加密集时序监督,使主干网络在训练阶段即获得长程动态约束。该方法在RoboTwin 2.0机器人操作基准的50项双臂任务上取得94.1%的平均成功率,达到该基准当前最优水平;在高帧率设定下收敛速度较此前最优方法提升2.3倍;并可在推理阶段保留预测模块以实现并行块生成,获得约2倍的推理加速。相关训练代码、评测流程与模型权重已在GitHub与Hugging Face平台完整开源,供学术界与工业界自由使用。

同期作为核心成员参与LingBot-VA 2.0原生视频—动作预训练模型的研发,通过联合学习未来帧预测与动作生成,提升机器人在开放场景下的通用操作能力。

三、三维视觉与深度感知的系统性积累

在转向世界模型之前,本人在立体匹配与深度估计方向已形成较为完整的技术体系:提出注意力连接代价体ACVNet(CVPR 2022)与实时版本Fast-ACV(T-PAMI 2024),提出迭代几何编码体IGEV(CVPR 2023)及其面向大视差与病态区域的扩展IGEV++(T-PAMI 2025),并针对移动端算力约束提出轻量化立体匹配网络BANet(ICCV 2025),在精度与效率两个维度持续推进技术边界。在单目深度方向,提出Pixel-Perfect Depth(NeurIPS 2025和TPAMI 2026),首次将像素空间扩散引入深度基础模型,可恢复无飞点的高质量三维点云。在计算摄影方向,提出HDRFlow(CVPR 2024),实现大运动场景下的实时高动态范围视频重建。上述工作代码均已开源。

四、科研项目与获奖

2024年获批首届国家自然科学基金博士研究生项目;2025年入选中国科协青年科技人才培育工程博士生专项计划;2024年获华中科技大学“学术新星”称号;获“挑战杯”全国赛特等奖、中国研究生人工智能创新大赛一等奖、小米奖学金;曾多次获得研究生国家奖学金。

五、学术服务与开源贡献

长期担任CVPR、ICCV、ECCV、NeurIPS、ICLR、AAAI、ICRA、SIGGRAPH Asia等国际顶级会议审稿人,以及T-PAMI、IJCV、TIP、RA-L等国际顶级期刊审稿人,累计承担审稿工作十余届次,以严谨客观的态度服务学术共同体。坚持将研究成果全部开源,为同行提供可复现的研究基础。作为课题组高年级博士生,主动与低年级同学合作开展研究并提供指导。

六、产学研实践

先后在上海人工智能实验室(计算摄影)、小米汽车(深度基础模型)、蚂蚁灵波(世界动作模型)、字节跳动Seed(具身大模型)从事研究实习,将前沿算法与机器人等实际应用场景紧密结合,推动研究成果的工程落地与产业转化。


湖北省武汉市洪山区珞喻路1037号东十七楼  电话:027-87792776  领导邮箱:husteic@hust.edu.cn

华中科技大学 电子信息与通信学院