第4章 工具详解与使用指南(2/3)· 图像/视频/语音/编程类

本章摘要:本章系统讲解图像生成、图像识别(CV)、视频生成与处理、语音处理、编程辅助五类 AI 工具。图像侧覆盖 Midjourney v7、FLUX/Stable Diffusion、即梦/通义万相/豆包图像;CV 侧介绍百度智能云、Google Vision、阿里云视觉的 API 能力;视频侧涵盖 Sora、Veo 3、可灵、即梦与剪映;语音侧包括科大讯飞、Whisper、ElevenLabs;编程侧讲解 GitHub Copilot、Cursor、通义灵码与 Claude Code。每类均给出工具介绍、使用方法、常见问题,并附 8 个可直接照做的操作示例与选型小结,帮助读者按需快速选型并上手实操。

本章基于 2026年8月 主流工具版本整理,覆盖图像生成、图像识别(计算机视觉)、视频生成与处理、语音处理、编程辅助五类工具。本章所有示例均可在对应平台上实操跟做,建议边读边动手。


学习目标

读完本章,你应该能够:

  1. 说出 Midjourney v7、FLUX/Stable Diffusion、即梦/通义万相/豆包图像 各自适合什么场景、怎么选。
  2. 理解 图像识别(CV)类 平台(百度智能云、Google Vision、阿里云视觉)能帮企业做什么(OCR、物体检测、内容审核)。
  3. 会用 Sora/Veo 3/可灵/即梦/剪映 中的至少一款做视频,并用剪映完成「图文成片」。
  4. 会用 科大讯飞听见、Whisper、ElevenLabs 完成会议转写与配音。
  5. VS Code / Cursor / Claude Code / 通义灵码 中完成一次 AI 编程辅助,并知道常见问题的排查办法。
  6. 面对一个具体需求(做图、剪视频、转写、写代码),能快速选出最合适的工具组合。

正文讲解

本章统一展开结构:一、工具介绍(核心功能 / 适用场景 / 优势对比)+ 二、使用方法(注册获取 / 基础步骤 / 高级功能示例 / 常见问题 FAQ)。


4.2 图像生成类

4.2.1 Midjourney(v7)

一、工具介绍

  • 核心功能:基于 v7 模型的文生图(text-to-image)。通过 Discord 或官网(midjourney.com)使用,输入一句话描述,AI 生成 4 张候选图。艺术风格、质感、光影审美在业内顶尖。

  • 适用场景:创意视觉、插画、概念图、海报草图、头像、产品灵感图。

  • 优势对比

    维度Midjourney v7对比
    出图审美极强,艺术感好优于多数开源/国内工具
    可控性中等(靠提示词与参数)弱于 FLUX + ControlNet
    文本排版弱,图中文字常错不适合做带字海报
    价格订阅制,无免费档高于国内免费工具
    中文提示可用,但中英混合更稳建议关键描述用英文
    二、使用方法
  • 注册获取:访问 midjourney.com 注册,或在 Discord 加入 Midjourney 服务器;订阅后解锁出图额度。

  • 基础步骤

    1. 在官网或 Discord 输入框键入 /imagine
    2. prompt: 后写描述,可加 --参数
    3. 等待约 30–60 秒生成 4 张图;
    4. 用按钮操作:❤️ 收藏、U1–U4(放大单张)、V1–V4(以某张做变体)、🔄 重绘(reroll)。
  • 高级功能示例(参数说明):

    • --ar 16:9:设置画面比例(aspect ratio),如横屏视频封面;
    • --s 750:风格化强度(stylize,0–1000),越高越「艺术化」;
    • --v 7:指定版本(默认即 v7);
    • --style raw:减少 AI「美化」,更贴近真实/原始描述;
    • --cref 图片URL:用参考图保持角色一致性(character reference)。
  • 常见问题 FAQ

    • Q:中文提示词能用吗?A:能,但建议中英混合(如「a cute cat, 中国风, ink painting」),关键名词用英文更准。
    • Q:能商用吗?A:较高档订阅支持商用,务必查订阅条款;图片版权归属依你的订阅等级而定。
    • Q:图里文字总是错?A:Midjourney 不擅长排版文字,需文字的海报建议用即梦/通义万相或后期 PS 加字。

4.2.2 Stable Diffusion / FLUX(开源生图)

一、工具介绍

  • 核心功能:开源可本地部署的文生图生态。经典 Stable Diffusion(含 SDXL、SD3),2024 起 Black Forest Labs 的 FLUX 成为开源画质新标杆(FLUX.1-dev 画质最佳)。

  • 适用场景:需要私有化、批量、可定制的工作流——电商批量主图、固定画风的品牌素材、科研/涉密不出域场景。

  • 优势对比

    维度FLUX / Stable Diffusion对比
    可控性最高(ControlNet/LoRA)强于 Midjourney
    数据隐私可完全本地,数据不出域强于云端工具
    成本免费(自部署)优于付费订阅
    上手门槛高,需显卡/部署高于网页工具
    画质FLUX.1-dev 接近商业级优于 SD1.5

二、使用方法

  • 注册获取:本地用 ComfyUI / WebUI(AUTOMATIC1111) 部署;或用云端(Replicate、硅基流动、阿里云 PAI)免部署直接调用。
  • 基础步骤:安装 WebUI/ComfyUI → 填「正向提示词」(想要什么)+「负向提示词」(不要什么)→ 设采样器/步数/尺寸 → 点 Generate 出图。
  • 高级功能示例:训练 LoRA 固定人物/风格;用 ControlNet 控制姿态/构图;通过 API 批量生成。
  • 常见问题 FAQ
    • Q:显存不足?A:用 SD1.5 或量化版,或改用云端 FLUX;本地建议 8GB 显存以上跑 FLUX.
    • Q:追求画质选哪个?A:优先 FLUX.1-dev;轻量快速选 FLUX.1-schnell。

4.2.3 国内图像生成(即梦 / 通义万相 / 豆包图像)

  • 介绍:中文提示词友好、国内访问便利、多在 App 内免费。即梦(字节)、通义万相(阿里)、豆包图像适合电商主图、头像、海报。
  • 使用:对应 App/网页直接「文生图 / 图生图」,支持中文描述与风格模板。
  • 对比:审美弱于 Midjourney,但零门槛、可商用友好、速度快,是中文用户的首选入门。

4.3 图像识别与计算机视觉(CV 类)

4.3.1 平台型视觉服务(百度智能云 / Google Cloud Vision / 阿里云视觉智能)

一、工具介绍

  • 核心功能:提供 OCR(文字识别)、人脸识别、物体检测、图像分类、内容审核等 API。本质上是一组「看懂图片」的能力,供开发者接入自己的系统。

  • 适用场景:企业票据识别、合同/证件扫描入库、产线瑕疵检测、安防、内容合规审核、无障碍读屏。

  • 优势对比

    平台长板典型场景
    百度智能云中文 OCR 强、文档全发票/证件/文档识别
    Google Vision国际通用、标签丰富跨境、多语言图像理解
    阿里云视觉智能电商/工业模板多商品检测、工业质检

二、使用方法(以百度智能云为例)

  • 注册获取:登录 ai.baidu.com → 控制台创建「文字识别 / 图像识别」应用 → 获取 API Key / Secret Key
  • 基础步骤:调用 REST API 或 SDK(Python/Java)→ 上传图片 → 解析返回 JSON(识别出的文字/标签/坐标框)。
  • 高级功能示例:用 OCR 批量提取发票字段入库;用「物体检测」做产线瑕疵筛查。
  • 常见问题 FAQ
    • Q:免费额度?A:各家均有有限免费额度,超量计费;涉密数据选私有化部署。
    • Q:识别不准?A:准确率受图像质量影响,需先做去噪/裁剪等预处理,并选对应专用模型。

4.4 视频生成与处理类

4.4.1 Sora(OpenAI)/ Veo 3(Google)

一、工具介绍

  • 核心功能:文生视频(text-to-video)标杆。Sora 擅长物理一致性与长镜头;Veo 3(2026)支持生成带同步音频/对白的高保真视频,集成于 Google Flow filmmaking 工具。
  • 适用场景:广告片、创意短片、故事板、概念预告。
  • 优势对比:国际最先进,但长/分辨率受限、按额度计费、国内访问需合规网络。

二、使用方法

  • 注册获取:Sora 在 ChatGPT / 专用入口(部分地区);Veo 3 在 Gemini / Google Flow;均需订阅或等待开放。
  • 基础步骤:输入描述文案(含镜头、主体、风格)→ 选时长/比例 → 生成 → 下载或二次剪辑。
  • 常见问题 FAQ
    • Q:国内能用吗?A:需合规网络;商用注意肖像权与版权。
    • Q:时长受限?A:受额度与模型上限限制,长片建议分段生成再拼接。

4.4.2 国内视频生成(可灵 / 即梦视频)

  • 介绍:可灵(快手)、即梦视频(字节)中文友好、门槛低、可图生视频;适合短视频、营销、教学。
  • 使用:对应 App/网页上传参考图或输入文案 → 选时长/比例 → 生成 → 剪辑导出。

4.4.3 剪映(CapCut)

一、工具介绍

  • 核心功能:AI 剪辑标杆——自动字幕、智能抠像、文案成片、AI 配音、数字人。
  • 适用场景:自媒体短视频、教学视频、企业宣传快速出片。
  • 优势对比:零门槛、模板多、中文优化好,是新手做视频的首选。

二、使用方法

  • 注册获取:下载剪映(PC/手机),免费即可用,会员去水印并解锁更多素材。
  • 基础步骤:导入素材 → 用「图文成片」输入文案自动出视频 → 用「智能字幕」识别语音 → 加「AI 配音 / 数字人」。
  • 常见问题 FAQ
    • Q:导出带水印?A:开通会员去除;免费版水印较小但存在。
    • Q:长视频卡顿?A:分段处理、降低预览分辨率,导出时再选高清。

4.5 语音处理类

4.5.1 科大讯飞

一、工具介绍

  • 核心功能:中文语音识别(ASR)与合成(TTS)领先,医疗/会议/教育场景成熟。产品含讯飞听见(会议转写)、讯飞开放平台(API)、讯飞星火(大模型)。
  • 适用场景:会议转写、有声书、配音、无障碍、课堂录音整理。
  • 优势对比:中文识别准、方言支持好、行业模板丰富,是中文语音首选。

二、使用方法

  • 注册获取:讯飞听见网页/App 直接用;开放平台注册 → 建应用 → 调 API。
  • 基础步骤:上传录音或实时录音 → 选语言/场景模型 → 自动转写 → 导出文稿。
  • 常见问题 FAQ
    • Q:方言/噪音下不准?A:选对应方言模型,靠近麦克风、减少背景音。
    • Q:实时转写没声音?A:检查浏览器/系统麦克风权限与网络。

4.5.2 Whisper(开源)/ ElevenLabs

一、工具介绍

  • Whisper(OpenAI,开源):多语言语音识别,可本地部署,隐私好。
  • ElevenLabs:高质量多语言 TTS 与声音克隆,拟真度极高。
  • 适用场景:Whisper 适合本地/批量转写;ElevenLabs 适合配音、有声内容、声音克隆。

二、使用方法

  • Whisper:命令行 whisper audio.mp3 --model medium,或用 Python 库;大模型吃显存,轻量用 base/small
  • ElevenLabs:网页上传文本 → 选音色 → 生成并下载音频;声音克隆注意授权与伦理合规。
  • 常见问题 FAQ:Whisper 显存不足换小模型;ElevenLabs 克隆须获得本人授权,避免侵权。

4.6 编程辅助类

前置准备(通用):① 安装 VS Code(code.visualstudio.com,免费);② 准备一个 GitHub / 对应平台账号并登录;③ 使用云端 Agent(如 Claude Code)需配置 API Key 并确认有足够额度;④ 确保网络可访问对应服务。

4.6.1 GitHub Copilot(Microsoft / OpenAI)

一、工具介绍

  • 核心功能:IDE 内代码补全与生成,支持 Chat 与「编码智能体(Coding Agent)」。边写边补全,也能对话问问题。
  • 适用场景:日常开发、自动写单元测试、文档生成、修 issue。
  • 优势对比:与 VS Code / GitHub 深度集成,团队工作流顺滑。
    二、使用方法
  • 注册获取:VS Code 扩展商店搜「GitHub Copilot」安装 → 登录 GitHub 并订阅。
  • 基础步骤:在编辑器输入注释或函数签名 → Copilot 灰字续写 → 按 Tab 接受、Esc 拒绝;Ctrl+I(或侧边图标)唤起 Copilot Chat 问问题。
  • 高级功能示例:选中代码问「优化这段并加测试」;用 @workspace 跨文件理解;指派 Coding Agent 自动修 issue。
  • 常见问题 FAQ
    • Q:补全不出来?A:确认已登录订阅、网络正常;检查右下角 Copilot 图标是否启用;重装扩展或重启 VS Code。
    • Q:企业代码隐私?A:用企业版/私有部署,或开启「不用于训练」设置。
    • Q:补全质量差?A:写更清晰的注释、变量名,或切换底层模型。

4.6.2 Cursor(AI 原生编辑器)

一、工具介绍

  • 核心功能:AI 原生编辑器,整库理解、多文件编辑、Agent 模式;默认接 Claude 系列,亦可切 GPT / 本地模型。
  • 适用场景:从零搭项目、跨文件重构、理解陌生代码库。程序员口碑极佳。
  • 优势对比:对话与编辑一体、索引全库后回答更准;Pro 订阅解锁高阶 Agent。

二、使用方法

  • 注册获取:下载 Cursor(cursor.com)→ 导入 VS Code 配置 → 登录账号。
  • 基础步骤:打开项目后等待索引(index)完成 → 用快捷键调用 AI。
  • 高级功能示例
    • Ctrl+K:就选中代码或当前文件直接「改代码」(如「把这个函数改成异步并加错误处理」);
    • Ctrl+L:打开对话侧栏,问「这个项目怎么跑起来?」「解释这个报错」;
    • Cmd+Shift+A(Win 上 Ctrl+Shift+A):启动 Agent,跨多个文件自动修改。
  • 常见问题 FAQ
    • Q:大仓库索引慢?A:在设置中把 node_modules、构建目录加入忽略(exclude),只索引源码。
    • Q:中文界面?A:支持,可在设置切换;补全与对话均可用中文。

4.6.3 通义灵码 / Claude Code(国内与进阶)

一、工具介绍

  • 通义灵码(阿里):国内免费、IDE 插件、中文好,适合日常补全与注释生成。
  • Claude Code(Anthropic):终端 Agent,对本地代码库做长程工程任务(重构/修复/测试),是 2026 年工程化热点。
  • 优势对比:灵码零成本上手快;Claude Code 自动化能力强,但需 API Key 与额度,且操作有破坏性。

二、使用方法

  • 通义灵码:VS Code / IDEA 扩展商店安装 → 登录阿里云账号即用。
  • Claude Code:终端进入项目目录,运行 claude 命令进入交互;它会按授权读写文件、执行命令(如跑测试、改代码)。
  • 权限说明(重要):Claude Code 执行文件删除、重写、跑 shell 命令等操作前,会弹出确认提示。请务必看清它将要做的事——尤其 rmgit reset --hard、覆盖文件等破坏性操作,必须二次确认再放行
  • 常见问题 FAQ
    • Q:Claude Code 报错无权限 / 调不动?A:检查 API Key 是否配置(环境变量 ANTHROPIC_API_KEY)、额度是否充足;首次运行按提示授予文件读写权限。
    • Q:它改错了文件?A:用 git status / git diff 查看改动,未提交前可 git checkout 回滚;养成「先 git 提交再让 Agent 动手」的习惯。
    • Q:灵码补全慢?A:检查网络与登录状态;大文件可手动触发补全。

操作示例

以下每个示例都给出「你输入的文字/命令」与「预期输出/效果」,可直接照做。

示例 1|Midjourney 出一张电影感海报

你输入的文字(Discord 或官网输入框)

/imagine prompt: a lone traveler standing on a neon-lit cyberpunk street at night, rain, cinematic lighting, highly detailed, --ar 16:9 --s 750 --v 7

预期输出/效果:约 30–60 秒后返回 4 张横屏(16:9)候选图,呈现雨夜赛博朋克街道、霓虹光影、电影质感。你可用 U1U4 放大最满意的一张,或 V 做变体。
参数说明--ar 16:9 横屏比例;--s 750 较高风格化;--v 7 指定 v7 模型(默认即 v7,可省略)。

示例 2|FLUX / Stable Diffusion(WebUI)基础生图

前置:本地部署 WebUI(或打开云端 FLUX 页面)。
你输入的文字(正向提示词)

正向:a cute orange cat wearing a scarf, studio lighting, soft background, 4k
负向:blurry, low quality, extra limbs, text

设置:采样器 Euler a,步数 25,尺寸 512×768。
预期输出/效果:生成一只戴围巾的橘猫,背景柔和、清晰无畸变。若出多余肢体/模糊,加强负向提示词或提高步数。

示例 3|剪映「图文成片」做一条短视频

你输入的文字(剪映「图文成片」输入框)

三分钟看懂人工智能:它像会学习的助手,从数据里找规律,帮你写文案、画图、剪视频。今天我们从最生活化的例子讲起……

操作步骤

  1. 打开剪映 → 首页点「图文成片」;
  2. 粘贴上面文案 → 点「生成」;
  3. 自动匹配素材、配音与字幕,生成初版视频;
  4. 在「文本」里改字幕,「音频」里换 AI 配音,「素材」里替换图片;
  5. 点「导出」。
    预期输出/效果:一条带配音、字幕、配图的短视频成片,无需手动剪辑即可发布或继续精修。
示例 4|GitHub Copilot 在 VS Code 中续写函数

前置准备:已装 VS Code + GitHub Copilot 插件并登录订阅。
你输入的文字(在 .py 文件里写注释)

# 写一个函数,计算列表中所有偶数的平均值,列表为空时返回 0
def avg_even(nums):

预期输出/效果:Copilot 以灰字给出续写,按 Tab 接受后类似:

    if not nums:
        return 0
    evens = [n for n in nums if n % 2 == 0]
    return sum(evens) / len(evens) if evens else 0

若未出现续写:检查右下角 Copilot 图标是否启用、已登录、网络正常(见 4.6.1 FAQ)。

示例 5|Cursor 用 Ctrl+K / Ctrl+L 改代码与对话

场景:有一段慢速的求和代码想并行优化。
你输入的命令/文字

  • 选中代码后按 Ctrl+K,输入:把这段改成用 sum() 和生成器,去掉循环
  • Ctrl+L 打开对话,输入:这个项目用了什么框架?怎么本地运行?
    预期输出/效果Ctrl+K 直接在原处生成改写后的代码(如 total = sum(x for x in items));Ctrl+L 基于已索引的代码库回答框架名称与启动命令(如 npm run dev)。
示例 6|Claude Code 终端工程任务(含权限确认)

前置准备:已配置 ANTHROPIC_API_KEY,进入项目目录。
你输入的命令(终端)

claude

进入交互后输入:

帮我把项目里所有 console.log 调试语句清理掉,并跑一遍测试确认没破坏功能

预期输出/效果:Claude Code 会先列计划并扫描文件,执行删除/修改前弹权限确认(如「将编辑 src/utils.js、运行 npm test」)。你确认后它动手,最后汇报改动与测试结果。
⚠️ 破坏性操作确认:若它提出要 rm 文件git reset --hard、覆盖重要文件,务必看清再放行;建议动手前先 git commit 留底,便于回滚。

示例 7|讯飞听见会议转写

你输入的步骤(讯飞听见网页/App)

  1. 登录讯飞听见 → 点「新建转写」;
  2. 上传会议录音 meeting.mp3,或点「实时录音」开始;
  3. 选语言「中文普通话」、场景「会议」;
  4. 等待转写完成 → 查看带说话人区分的文字稿;
  5. 点「导出」选 Word/PDF。
    预期输出/效果:得到一份按时间轴、区分说话人的会议文字记录,可一键导出用于纪要整理。
示例 8|Whisper 本地转写(备选)

你输入的命令(终端)

whisper meeting.mp3 --model medium --language Chinese

预期输出/效果:在当前目录生成 meeting.txt / .srt / .vtt 等文件,内容为中文转写文本与时间轴字幕。显存不足时把 medium 换成 smallbase


小结回顾

需求首选工具备选 / 说明
最好看的图、创意灵感Midjourney v7审美最强,但需付费、文字排版弱
可控/批量/不出域出图FLUX / Stable Diffusion开源免费可本地,门槛高
零门槛中文出图即梦 / 通义万相 / 豆包图像免费、快、商用友好
企业要识别图片文字/物体百度智能云 / 阿里云视觉 / Google Vision接 API,注意免费额度与隐私
国际顶级文生视频Sora / Veo 3需订阅/合规网络,时长受限
中文短视频/营销片可灵 / 即梦视频门槛低、可图生视频
快速剪出成片剪映图文成片+智能字幕,新手首选
会议/课堂转文字讯飞听见(中文最强)备选 Whisper(本地/多语言)
高质量配音/有声ElevenLabs注意声音克隆授权合规
日常写代码补全GitHub Copilot / 通义灵码灵码免费中文好,Copilot 集成深
重构/跨文件大改Cursor / Claude CodeCursor 编辑器内;Claude Code 终端 Agent,破坏性操作务必确认
长程自动化工程任务Claude Code配 API Key,先 git 提交再放手

一句话选型心法

  • 出图——要美选 Midjourney,要可控选 FLUX,要省事选国内三件套。
  • 视频——要快剪选剪映,要创意选可灵/即梦,要顶级选 Sora/Veo 3。
  • 语音——转写选讯飞听见,配音选 ElevenLabs。
  • 写代码——补全选 Copilot/灵码,大改选 Cursor,自动化工程选 Claude Code(记得确认权限)。

下一章(4.3 部分)将继续讲解数据分析、办公效率、学习研究、智能体等类别工具。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐