2 天 · 大模型图像与视频处理技术 + YOLO

大模型图像与 视频处理实战

把多模态推理、OpenCV 视觉处理与 YOLO 目标检测连接成一条可落地的能力链

从多模型对话与提示词安全开始,进入图像理解、OCR、文生图、函数调用、图像和视频处理,再完成目标检测数据准备、训练和自定义模型预测,构建 AI + CV 的完整应用视角。

2 天 多模态与视觉集中实战
4 由推理到检测的核心单元
LLM + CV 语言推理与视觉感知
YOLO 训练与自定义检测模型

COURSE OVERVIEW

让大模型理解图像,让视觉系统识别现实世界

生成式 AI 与计算机视觉正在共同改变图像和视频应用的工作方式:大模型可以理解图片、生成内容、调度工具;视觉算法可以处理视频流、定位目标、识别文本并保护隐私。课程以这两类能力为主线,带你建立从推理到感知的完整技术视角。

你将从多轮对话和提示词工程进入多模态图像理解,再使用 OpenCV 处理图片与视频,最后完成 YOLO 目标检测的资料准备、训练、预测与自定义模型使用。

多模型协同 理解模型、角色、消息、多轮对话和跨模型 API 的应用方式
多模态理解 完成图片分类、车牌文字提取、文生图海报与工具调用实践
OpenCV 视觉链路 覆盖图像、视频、色彩、变换、形态学、边缘、轮廓和识别
YOLO 目标检测 从数据标注、数据集构建到模型训练、预测与自定义模型使用

LEARNING PATH

两天贯通“理解、生成、处理、检测”的视觉智能工作流

先让模型理解指令和图像,再进入图像、视频和目标检测任务,把独立工具串成完整的解决方案链路。

01

理解模型与角色

认识大模型、消息角色、多轮对话与跨模型协同。

02

控制提示与安全

学习提示词原则、结构化表达与防注入思路。

03

调用多模态能力

让模型理解图片、提取文字、生成海报与调用工具。

04

处理图像与视频

运用 OpenCV 完成色彩、变换、滤波、边缘和轮廓处理。

05

识别与隐私保护

进入人脸、眼睛、车牌等识别任务以及马赛克处理场景。

06

训练 YOLO 模型

准备数据、标注、训练、预测并使用自己的检测模型。

COURSE FOCUS

面向图像与视频任务的 AI + CV 组合能力

01

多模型对话与角色

理解模型、消息与角色定位,完成多轮对话机器人,并认识不同大模型 API 的协同使用方式。

02

提示词工程与防护

围绕提示词原则、结构化表达、常用技巧和防攻击思路,提升模型调用的稳定性与可控性。

03

多模态图像应用

使用多模态能力进行图片分类、车牌文字提取、文生图海报设计和在线搜索工具调用。

04

OpenCV 图像与视频处理

从图像加载、色彩空间、通道运算、变换到视频采集与录制,建立视觉处理的基本操作能力。

05

形态学与视觉识别

通过腐蚀膨胀、滤波、边缘、轮廓、模板匹配和级联分类器,连接图像处理与识别任务。

06

YOLO 自定义检测

掌握数据准备、标注、训练参数、模型预测与自定义模型使用,走进目标检测实战。

FULL CURRICULUM

课程模块与学习安排

四个单元覆盖大模型、多模态、图像视频处理与 YOLO 训练,由模型调用逐步深入到视觉应用的训练与部署准备。

DAY 01

多模型与多模态视觉

单元 1 - 2
  1. 01
    大语言模型与对话应用 认识 DeepSeek 类模型的工作方式、常用模式、提示词原则与防攻击思路;理解 OpenAI 核心概念、消息、角色、多轮对话和智能聊天机器人,并了解多类大模型 API 的应用方式。
  2. 02
    提示词工程与多轮机器人实践 围绕提示词共识、实用技巧、角色定位和消息组织,完成多轮聊天机器人的应用练习,提升模型调用的上下文控制能力。
  3. 03
    多模态图像理解与生成 学习图片分类、车牌号码提取、文生图与海报设计,并使用函数调用组织在线搜索等工具能力,形成从理解到生成再到工具协同的多模态体验。
  4. 04
    OpenCV 图像与视频入门 掌握图像加载、窗口显示、鼠标交互、视频采集与录制;理解 HSV、HSL、YUV 等色彩空间、通道运算、边界填充、融合、缩放、翻转、旋转与仿射变化。
DAY 02

OpenCV 深度视觉与 YOLO

单元 3 - 4
  1. 05
    形态学、滤波与边缘分析 学习腐蚀、膨胀、开闭运算、梯度、礼帽、黑帽、阈值、滤波与 Canny 边缘检测,把图像处理方法用于目标区域的提取和增强。
  2. 06
    视频流与视觉识别案例 综合使用视频捕获、仿射变换、马赛克、轮廓、模板匹配、特征提取与分类器,完成摄像头人脸和眼睛捕获、人脸替换、车牌捕获与识别等实践。
  3. 07
    YOLO 目标检测基础 了解 YOLO 框架、安装、模型预测方式与常用参数,快速建立目标检测的执行和调试视角。
  4. 08
    YOLO 数据与自定义模型训练 完成数据准备、数据标注、数据集构建、模型训练与预测,尝试使用自己的检测模型处理目标识别任务。

LEARNING EXPERIENCE

在具备基础后,进入更完整的视觉智能实战

课程适合已具备 Python 数据分析、线性代数和概率统计基础的学习者。通过讲解、演示、案例、练习与答疑,把大模型调用和计算机视觉方法连成能够持续扩展的技术能力。

适合的基础 具备 Python 数据分析、线性代数和概率统计基础,准备向 AI 视觉方向进阶的学习者。
学习方式 小班精讲,支持面授或直播,结合操作演示、案例分析、练习实践与即时交流答疑。
实践导向 通过机器人、OCR、海报、视频流、隐私马赛克、识别与目标检测案例理解技术组合。
课后支持 提供一年内课程答疑、资料升级分享、录播回看与免费重修支持。

LEARNING OUTCOMES

完成学习后,你将能够

理解语言模型、多模态能力与视觉检测之间的协作关系,并围绕图像与视频任务完成基础实现和迭代。

01

组织多模型、多角色的对话应用

能够理解消息和角色定位,使用提示词与多轮上下文构建更可控的聊天机器人逻辑。

02

使用多模态能力处理图像任务

能够完成图片分类、文字信息提取、文生图海报设计与工具调用等典型图像应用练习。

03

完成图像与视频的基础处理

能够使用 OpenCV 处理图像加载、色彩通道、融合、缩放、旋转、透视与视频采集等工作。

04

运用形态学和特征方法分析视觉内容

能够结合腐蚀膨胀、滤波、边缘、轮廓和模板匹配,改善图像质量并识别目标区域。

05

实现人脸、车牌与隐私处理场景

能够理解摄像头捕获、人脸与眼睛识别、人脸替换、车牌识别及马赛克隐私保护的实现路径。

06

训练并使用自定义 YOLO 检测模型

能够完成数据准备、标注、数据集构建、训练、预测和自定义模型试用的基本流程。

PRACTICE SCENARIOS

让每个视觉能力,都对应一个用户能感知的应用场景

课程用对话、图片理解、视觉处理和目标检测案例串联关键技术,帮助你在“调用模型”和“设计完整工作流”之间建立联系。

对话与工具 多轮聊天与在线搜索
多模态视觉 OCR、海报与图片理解
视频检测 人脸、车牌与自定义目标

PRACTICE TOOLKIT

贯穿课程的视觉智能工具链

LLM APPLICATION

多模型 API

组织模型、消息、角色、多轮对话、提示词与工具调用能力。

MULTIMODAL AI

图像理解与生成

连接图片分类、文字提取、文生图海报与多模态任务处理。

COMPUTER VISION

OpenCV

处理图像、视频、形态学、边缘、轮廓、模板与识别应用。

OBJECT DETECTION

YOLO

围绕数据标注、数据集构建、训练、预测和自定义模型使用展开。

让大模型推理与视觉感知,一起服务于真实的图像和视频任务

围绕你的学习基础和应用方向了解课程安排、视觉案例与进阶路径。

咨询课程