理解模型与角色
认识大模型、消息角色、多轮对话与跨模型协同。
COURSE OVERVIEW
生成式 AI 与计算机视觉正在共同改变图像和视频应用的工作方式:大模型可以理解图片、生成内容、调度工具;视觉算法可以处理视频流、定位目标、识别文本并保护隐私。课程以这两类能力为主线,带你建立从推理到感知的完整技术视角。
你将从多轮对话和提示词工程进入多模态图像理解,再使用 OpenCV 处理图片与视频,最后完成 YOLO 目标检测的资料准备、训练、预测与自定义模型使用。
LEARNING PATH
先让模型理解指令和图像,再进入图像、视频和目标检测任务,把独立工具串成完整的解决方案链路。
认识大模型、消息角色、多轮对话与跨模型协同。
学习提示词原则、结构化表达与防注入思路。
让模型理解图片、提取文字、生成海报与调用工具。
运用 OpenCV 完成色彩、变换、滤波、边缘和轮廓处理。
进入人脸、眼睛、车牌等识别任务以及马赛克处理场景。
准备数据、标注、训练、预测并使用自己的检测模型。
COURSE FOCUS
理解模型、消息与角色定位,完成多轮对话机器人,并认识不同大模型 API 的协同使用方式。
围绕提示词原则、结构化表达、常用技巧和防攻击思路,提升模型调用的稳定性与可控性。
使用多模态能力进行图片分类、车牌文字提取、文生图海报设计和在线搜索工具调用。
从图像加载、色彩空间、通道运算、变换到视频采集与录制,建立视觉处理的基本操作能力。
通过腐蚀膨胀、滤波、边缘、轮廓、模板匹配和级联分类器,连接图像处理与识别任务。
掌握数据准备、标注、训练参数、模型预测与自定义模型使用,走进目标检测实战。
FULL CURRICULUM
四个单元覆盖大模型、多模态、图像视频处理与 YOLO 训练,由模型调用逐步深入到视觉应用的训练与部署准备。
LEARNING EXPERIENCE
课程适合已具备 Python 数据分析、线性代数和概率统计基础的学习者。通过讲解、演示、案例、练习与答疑,把大模型调用和计算机视觉方法连成能够持续扩展的技术能力。
LEARNING OUTCOMES
理解语言模型、多模态能力与视觉检测之间的协作关系,并围绕图像与视频任务完成基础实现和迭代。
能够理解消息和角色定位,使用提示词与多轮上下文构建更可控的聊天机器人逻辑。
能够完成图片分类、文字信息提取、文生图海报设计与工具调用等典型图像应用练习。
能够使用 OpenCV 处理图像加载、色彩通道、融合、缩放、旋转、透视与视频采集等工作。
能够结合腐蚀膨胀、滤波、边缘、轮廓和模板匹配,改善图像质量并识别目标区域。
能够理解摄像头捕获、人脸与眼睛识别、人脸替换、车牌识别及马赛克隐私保护的实现路径。
能够完成数据准备、标注、数据集构建、训练、预测和自定义模型试用的基本流程。
PRACTICE SCENARIOS
课程用对话、图片理解、视觉处理和目标检测案例串联关键技术,帮助你在“调用模型”和“设计完整工作流”之间建立联系。
PRACTICE TOOLKIT
组织模型、消息、角色、多轮对话、提示词与工具调用能力。
连接图片分类、文字提取、文生图海报与多模态任务处理。
处理图像、视频、形态学、边缘、轮廓、模板与识别应用。
围绕数据标注、数据集构建、训练、预测和自定义模型使用展开。
围绕你的学习基础和应用方向了解课程安排、视觉案例与进阶路径。