人工智能与AIGC:大模型驱动下的可持续视觉智能新生态——以腾讯混元图像3.0为例探索多模态学习方法在图像生成中的应用 开始日期:2026-10-10 课时安排:6周在线小组科研+5周论文指导 适合人群 适合年级 (Grade): 高中生/大学生 适合专业 (Major): 对计算机科学、人工智能、图像处理、大模型、AIGC等方向感兴趣的学生 建议具备Python编程基础(先导课) 了解深度学习基本原理 中文授课英文ppt,建议具备英文阅读能力 导师介绍 L老师 南洋理工大学终身教授 南洋理工大学 QS专排亚洲Top2 L老师 终身教授 博士生导师 新加坡国立大学 博士 多次获得ICDAR比赛一等奖 曾任 新加坡科技研究局信息通信研究所图像和普适性访问实验室 联合主席 研究方向:计算机视觉与传感、图形与交互式计算、图像和视频分析、神经技术 L老师现任南洋理工大学Associate Professor,于计算机视觉国际顶级期刊发表论文百余篇,并在这些研究领域共同撰写了多达10项专利。目前是《模式识别(PR)和神经计算》杂志的副主编。曾任新加坡科技研究局(A*SATR)下属的信息通信研究所(I2R)视觉注意力实验室负责人、卫星部副主任、图像和普适性访问实验室联合主席。 项目背景 本AIGC项目围绕生成式人工智能中的经典任务——文生图(text-to-image),图生图(image-to-image),文生视频(text-to-video)等技术展开,系统介绍视觉与语言跨模态建模的核心思想与技术路线。课程将从图像表示学习与文本语义建模的基础出发,逐步讲解跨模态生成中的图像理解、语义对齐以及条件生成的关键原理,帮助学员建立从“图像如何被模型理解”到“文本如何驱动视觉生成”的完整认知框架。通过对典型的模型结构和训练范式的讲解和分析,学生能够深入理解AIGC在多模态内容生成中的技术本质,而不仅仅停留在工具使用层面。 项目介绍 在具体内容上,课程将重点介绍视觉语言生成中的图像描述与视觉-语言对齐方法,以及视觉语言生成中的生成模型与文本条件控制机制,并结合经典视觉语言生成方法与主流技术路线进行对比分析。课程通过丰富的案例,展示这些技术在内容创作、娱乐游戏、以及科研分析等场景中的实际应用,同时讨论生成质量评估、可控性与局限性等关键问题。通过本课程学习,学员不仅能够清晰理解图生文技术和文生图技术的设计思想和方法,还能掌握将相关方法迁移到实际应用中的场景,为进一步学习多模态大模型和AIGC系统开发奠定坚实基础。 项目大纲 AIGC基础介绍:AIGC简介、对抗生成网络、自回归生成模型、VQ-VAE网络、Transformer网络、扩散生成模型 文生图技术I:文生图技术简介、基于对抗学习的文生图技术、基于自回归模型的文生图技术、基于guidance的文生图技术 文生图技术II:基于扩散模型的文生图技术、基于对比预训练的文生图技术、基于多模态基础模型的文生图技术 图生图技术:图生图技术简介、基于对抗学习的图生图技术、基于扩散模型的图生图技术、基于guidance的图生图技术 文生视频技术:文生视频技术简介、自回归文生视频技术、基于扩散模型的文生视频技术、基于I2V的文生视频技术、基于世界模型的文生视频技术 学生研究方向线上答辩:学生作品报告展示、评价和指导 项目收获 6周【在线小组科研+全球就业力大师课】+5周论文指导,共126课时 1500字左右的项目报告 优秀学员获得主导师推荐信(8封网推) 项目结业证书 EI/CPCI/Scopus/ProQuest/Crossref/EBSCO或同等级别索引国际会议全文投递与发表指导或者CNKI检索的英文普刊全文投递与发表指导 想要了解更多课题详情欢迎联系我们。 以上就是本次的科研推荐,如果想要了解更多信息,欢迎联系我们哦!

上一篇:2027杜伦大学经济学硕士:38%录取率的硬核项目,计量经济学+高级宏观微观,毕业生去了央行还是投行?
下一篇:返回列表
直接添加小助手阿星
微信号:nan2xing