# AI 生成式媒体全面认知手册  
## 生图 · 视频 · 音频（含音乐/语音）

> **目标**：对 **AI 生成图像、视频、音频（语音/音乐/音效）** 建立全面认知——5 分钟总览，也可下钻技术、产品、版权与工作流。  
> **方法**：规划 → **4 轮迭代调研** → 合成双层文档（简介表 + 详细说明 + 可追溯链接）。  
> **日期**：2026-07-13  
> **注意**：生成式产品版本与榜分 **周级变化**；选型以你实测与官网当日为准。文中具体型号为调研时点的产业共识快照。

**姊妹文档**  
- `纯AI领域全面认知手册.md`（语言/Agent 等）  
- `AI与量子计算_全面认知手册.md`  

---

# 阅读导航

| 时间 | 读什么 |
|------|--------|
| **5 分钟** | [§0 总览](#0-五分钟总览) + [附录作弊条](#附录一页纸作弊条) |
| **30 分钟** | §0–§3 + §7 选型 + §8 风险 |
| **深挖图像** | §4 |
| **深挖视频** | §5 |
| **深挖音频** | §6 |
| **方法复用** | [§11 四轮迭代记录](#11-规划与四轮迭代过程) |

---

# 目录

0. [五分钟总览](#0-五分钟总览)  
1. [概念词典与模态地图](#1-概念词典与模态地图)  
2. [技术底座：扩散 · DiT · 潜空间 · 自回归](#2-技术底座扩散--dit--潜空间--自回归)  
3. [现状全景：三模态对照](#3-现状全景三模态对照)  
4. [图像生成深挖](#4-图像生成深挖)  
5. [视频生成深挖](#5-视频生成深挖)  
6. [音频生成深挖（语音·音乐·音效）](#6-音频生成深挖语音音乐音效)  
7. [跨模态工作流与选型指南](#7-跨模态工作流与选型指南)  
8. [版权·深伪·合规与伦理](#8-版权深伪合规与伦理)  
9. [产业·公司·商业模式](#9-产业公司商业模式)  
10. [未来情景与时间线](#10-未来情景与时间线)  
11. [规划与四轮迭代过程](#11-规划与四轮迭代过程)  
12. [学习路径](#12-学习路径)  
13. [链接总库](#13-链接总库)  
14. [诚实边界](#14-诚实边界)  
[附录：一页纸作弊条](#附录一页纸作弊条)

---

# 0. 五分钟总览

## 0.1 简介

生成式媒体已从「好玩 demo」进入 **生产素材流水线**：静帧基本可用、短视频快速可用但仍不稳、语音极成熟、音乐「能听」但版权与版权方博弈激烈。

## 0.2 三模态一句话

| 模态 | 现在什么水平 | 还差什么 | 你现在怎么用 |
|------|--------------|----------|--------------|
| **图像** | 最高成熟：2K/4K、可控、开源生态全 | 品牌一致性、复杂排版、法律清晰度 | 概念/营销/电商主图，人审关键视觉 |
| **视频** | 秒～十几秒高质量片段；多模型原生声画 | 长镜头一致性、可控剪辑、物理偶崩 | 广告分镜、社媒短片、预可视化 |
| **音频-语音** | TTS/克隆接近商用广播 | 情感长程、防滥用 | 配音、有声书、语音 Agent |
| **音频-音乐** | 完整歌曲可听 | 版权诉讼、可编辑性、专业母带 | 草稿/BGM；商用要查授权 |

## 0.3 与「大模型聊天」的关系

| 层 | 角色 |
|----|------|
| 语言模型 / 多模态 LLM | 写提示、改脚本、分镜、审片 |
| 专用生成模型 | 真正出像素/波形 |
| Agent / 工作流 | 批量、版本、品牌库、合规检查 |

## 0.4 生态结构（文字图）

```
提示 / 参考图 / 音频条件
        │
        ▼
┌───────────────────┐
│  专用生成模型栈     │  图像 DiT/扩散 · 视频时空 DiT · 音频扩散/编解码
└─────────┬─────────┘
          │
    ┌─────┼─────┐
    ▼     ▼     ▼
  静帧   短视频  语音/曲
    │     │     │
    └─────┴─────┘
          │
    剪辑·合成·配乐·字幕·发布
          │
    版权·水印·深伪检测·平台政策
```

## 0.5 Index 侧旁证（下载与能力）

Stanford HAI *AI Index 2026* 相关取向：

| 点 | 说明 |
|----|------|
| 下载结构 | Hugging Face 热门中，文本生成占比高；**图像生成** 为重要第二类；视频生成份额上升但仍小于图像（报告图示量级：文生约 42%、图像约 26%、多模态约 13%、视频约 5% 等——以 PDF 为准） |
| 能力 | 视频生成开始出现「像会物理直觉」的零样本行为叙述（如 Veo 相关 zero-shot 研究） |
| 短板 | Index 仍将 **连贯真实视频** 等列为相对落后任务族之一 |

- Index：https://hai.stanford.edu/ai-index/2026-ai-index-report  
- Technical：https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance  
- PDF：https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf  

---

# 1. 概念词典与模态地图

## 1.1 生成任务类型

| 任务 | 输入 | 输出 | 简介 |
|------|------|------|------|
| T2I | 文本 | 图像 | 文生图 |
| I2I | 图+文本 | 图像 | 改图、风格、局部 |
| T2V | 文本 | 视频 | 文生视频 |
| I2V | 图+文本 | 视频 | 图生视频（常更可控） |
| V2V | 视频+条件 | 视频 | 风格/运动迁移 |
| TTS | 文本 | 语音 | 文本转语音 |
| STS / 克隆 | 参考声+文本 | 语音 | 声音复刻 |
| T2M | 文本/歌词 | 音乐 | 文生曲/带唱 |
| 音效 | 文本/视频 | SFX | 环境声、拟音 |
| AV 联合 | 文本/多模态 | 视频+音轨 | 原生声画一体 |

## 1.2 控制与质量术语

| 术语 | 简介 | 详细说明 |
|------|------|----------|
| Prompt adherence | 听不听话 | 提示词还原度 |
| Identity consistency | 角色一致性 | 同人多镜是否像同一人 |
| Temporal consistency | 时间一致 | 视频帧间闪烁、形变 |
| Controllability | 可控性 | ControlNet、相机、遮罩、参考 |
| LoRA / Fine-tune | 小样本定制 | 品牌、角色、画风 |
| Upscale | 超分 | 提分辨率；优质模型原生 2K/4K 减少依赖 |
| Latent space | 潜空间 | 压缩后再扩散，省算力 |
| CFG / 采样步数 | 引导与步数 | 质量-速度权衡 |
| Watermark / C2PA | 来源标记 | 溯源与合规 |
| Deepfake | 深度伪造 | 仿人脸/声线滥用风险 |

## 1.3 闭源 API vs 开源本地

| | 闭源云 | 开源/可自托管 |
|--|--------|----------------|
| 质量峰值 | 常领先或并列 | FLUX 等已逼近/局部超越 |
| 定制 | 有限 | LoRA/ComfyUI 极强 |
| 成本结构 | 按张/秒/分钟 | GPU 与电 |
| 合规 | 服务条款清晰度不一 | 训练数据与输出权责自担 |
| 适合 | 快速上线、企业采购 | 隐私、批量、垂直微调 |

---

# 2. 技术底座：扩散 · DiT · 潜空间 · 自回归

## 2.1 简介

懂底座才能判断「下一代会卡在哪」。

## 2.2 扩散模型（Diffusion）

| 步骤 | 简介 |
|------|------|
| 训练 | 学「从噪声还原数据」 |
| 推理 | 从随机噪声多步去噪成图/视频/频谱 |
| 优势 | 画质高、多样性好 |
| 代价 | 步数多则慢（有蒸馏加速） |

经典潜空间扩散（LDM）思路：先 VAE 压到潜空间再扩散——Stable Diffusion 族核心。

## 2.3 Diffusion Transformer（DiT）

| 点 | 说明 |
|----|------|
| **是什么** | 用 **Transformer** 替换扩散里的 U-Net 骨干 |
| **为何重要** | 更易缩放；成 2024–2026 图像/视频主流架构之一 |
| **视频** | 在时空 patch / 潜空间 token 上做注意力（Sora 类「时空补丁」叙事） |
| **入门论文** | Peebles & Xie, *Scalable Diffusion Models with Transformers*：https://www.wpeebles.com/DiT.html |
| **视频综述笔记** | Lilian Weng 扩散视频：https://lilianweng.github.io/posts/2024-04-12-diffusion-video/ |

## 2.4 其他范式（简介）

| 范式 | 用在 | 简介 |
|------|------|------|
| 自回归视觉 | 部分图/视频 | 像 LLM 一样预测下一 token；与扩散竞争/混合 |
| 流匹配 / 一致性模型 | 加速生成 | 少步甚至单步 |
| 编解码音频 (codec LM) | 音乐/语音 | 离散音频 token + 语言模型 |
| 声码器/神经编解码 | TTS | 声学特征 → 波形 |

## 2.5 视频比图像难在哪

| 难点 | 简介 |
|------|------|
| 时间维 | 帧间一致、运动合理 |
| 算力 | 分辨率×帧数爆炸 |
| 物理 | 流体、碰撞、手-物 |
| 可控剪辑 | 分镜、镜头语言 |
| 声画同步 | 口型、环境声 |

Index 取向：视频模型开始展现部分 **zero-shot 物理/推理** 迹象，但「全程连贯真实长视频」仍是公认难关。  
技术章：https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance  

---

# 3. 现状全景：三模态对照

## 3.1 成熟度雷达（2026 中主观标尺）

| 维度（1–5） | 图像 | 视频 | 语音 TTS | 音乐 |
|-------------|------|------|----------|------|
| 默认可用质量 | 5 | 3.5–4 | 5 | 3.5–4 |
| 可控/可编辑 | 4.5 | 3 | 4 | 2.5–3 |
| 开源生态 | 5 | 3 | 3.5 | 2.5 |
| 商用法律清晰 | 3 | 3 | 3 | **2** |
| 实时/低延迟 | 4 | 2–3 | **5**（部分 <100ms） | 2–3 |
| 长内容 | 5（单图） | **2**（长片） | 4 | 3（整曲可） |

## 3.2 能力跃迁时间线（粗）

| 年 | 图像 | 视频 | 音频 |
|----|------|------|------|
| 2022–23 | SD 爆火、MJ 美学 | 短、糊、闪 | 早期音乐 demo；TTS 商用化 |
| 2024 | SD3/FLUX 崛起 | Sora 示范、Runway/Kling 等军备 | Suno/Udio 爆款；克隆语音普及 |
| 2025–26 | 2K/4K 标配、多参考、开源逼近闭源 | 原生音画、10s 级精品、企业工具链 | ElevenLabs 进军音乐；实时 TTS 军备 |

---

# 4. 图像生成深挖

## 4.1 简介

**最成熟的生成模态**：营销、电商、概念设计、游戏原画流水线已日常使用。

## 4.2 玩家与定位（快照，会变）

| 产品/模型族 | 类型 | 简介（产业共识取向） | 详细说明 |
|-------------|------|----------------------|----------|
| **Midjourney** | 闭源 | 美学/艺术向强 | 设计师喜爱；社区与风格感 |
| **FLUX 族** (Black Forest Labs) | 开源权重 + API | 开源侧画质与听指令标杆 | pro/flex API；dev 等可自托管；多参考、高分辨率叙事 |
| **Stable Diffusion 3.5** | 开源生态 | 工具链最广 | ComfyUI/LoRA/ControlNet 生态；许可注意营收门槛 |
| **OpenAI 图像** (GPT Image 等) | 闭源 | 聊天集成、部分榜领先叙事 | 易用；与 ChatGPT 工作流一体 |
| **Google 图像** (Imagen / 产品侧 Nano Banana 等命名) | 闭源 | 高分辨率、生态集成 | 与 Gemini/搜索生态 |
| **Ideogram 等** | 闭源 | 文字渲染 | 海报字较好的细分 |
| **Recraft 等** | 闭源 | 设计系统/矢量向 | 品牌与 UI 资产 |

行业对比解读例（非论文，作地图）：  
https://tech-insider.org/best-ai-image-generator-2026/  
开源列表例：https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-models  

**排行榜参考（变化快）**：Artificial Analysis Image Arena 等  
https://artificialanalysis.ai/image/leaderboard/text-to-image  

## 4.3 能力清单（2026）

| 能力 | 状态 | 说明 |
|------|------|------|
| 原生 2K/4K | 高端标配 | 减少「先糊后超分」 |
| 提示词遵循 | 显著提升 | FLUX 等以 adherence 著称 |
| 图中文字 | 改善但仍挑模型 | Ideogram 等细分 |
| 多参考/角色一致 | 可用 | 品牌角色仍要微调或工作流 |
| ControlNet/姿态/深度 | 开源极强 | 生产控制主力 |
| 局部重绘 inpaint | 成熟 | 修图工作流 |
| 批量 API | 成熟 | 电商 SKU |

## 4.4 工作流组件

| 组件 | 简介 |
|------|------|
| ComfyUI / Forge 等 | 节点式本地流水线 |
| LoRA / DreamBooth | 人/产品/风格 |
| IP-Adapter / 参考 | 保持主体 |
| 放大/修脸/细节 | 后处理 |
| 素材库 + 元数据 | 版本与版权记录 |

## 4.5 选型简表

| 你的需求 | 更可能优先试 |
|----------|----------------|
| 最美概念艺术 | Midjourney 类 |
| 听指令 + 可自托管 | FLUX dev/开源族 |
| 最大插件生态 | SD 3.5 + ComfyUI |
| 和 GPT 一起改图 | OpenAI 图像 |
| 海报汉字/字母 | 专测文字模型 |
| 企业 SLA | 云厂商合同产品 |

---

# 5. 视频生成深挖

## 5.1 简介

2025–2026：**短视频精品化 + 原生音频** 是主跃迁；长片叙事与镜头级剪辑仍靠人+工具。

## 5.2 玩家与定位（快照）

| 产品 | 简介（产业共识取向） | 详细说明 / 注意 |
|------|----------------------|-----------------|
| **Google Veo** (+ Flow 等创作壳) | 电影感、企业安全叙事、原生音画 | 常被当作「精品/企业」首选之一 |
| **Kling** (快手) | 性价比、运动、口型/角色向功能 | 多评测称「大众最优性价比」 |
| **Runway** | 创作工作区 + 生成 | 控制与剪辑向；制作团队友好 |
| **OpenAI Sora** | 物理/运动标杆叙事 | 有产品线收缩/停服时间表的产业报道——**部署前必查官网现状** |
| **Luma Dream Machine** | 运动自然、I2V | 概念到动态 |
| **Pika 等** | 轻量、玩法 | 入门与特效 |
| **Seedance 等** | 声画联合、口型 | 对话镜头向 |

对比解读例：  
https://tech-insider.org/best-ai-video-generator-2026/  
https://lushbinary.com/blog/ai-video-generation-sora-veo-kling-seedance-comparison/  

**重要**：Sora 消费端/API 停用时间表以 OpenAI 官方帮助中心为准（产业文多有引用，请核验）：  
检索 `OpenAI Sora discontinuation` 或 help.openai.com。

## 5.3 能力清单（2026）

| 能力 | 状态 | 说明 |
|------|------|------|
| 5–15 秒精品 | 常用 | 广告、社媒 |
| 原生同步音频 | 多旗舰支持 | 减后期配音步骤 |
| 1080p / 部分 4K | 分层 | 看套餐 |
| I2V 可控 | 常优于纯 T2V | 先定构图 |
| 口型/角色 | 进步快 | 仍有崩 |
| 物理合理性 | 改善 | 手、文字、长程仍翻车 |
| 镜头语言 | 部分提示可用 | 专业摄影需试 |
| 长视频故事 | **弱** | 分段生成+剪辑 |

## 5.4 Index 技术点（视频）

AI Index Technical 叙述例：Veo 3 在大规模生成测试中展现浮力、迷宫等 **未专门训练任务上的行为**，被讨论为「视频模型作为 zero-shot 学习者」方向。  
来源页：https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance  
相关研究入口：https://video-zero-shot.github.io  

## 5.5 生产工作流（推荐心智）

```
剧本/分镜（LLM）
  → 关键帧静图（T2I，定角色与光）
  → I2V / T2V 出镜头
  → 不合格镜重生或 Runway 类工具修
  → 人剪 + 配乐/对白修
  → 合规水印与发布
```

## 5.6 选型简表

| 需求 | 优先取向 |
|------|----------|
| 电影感精品短片 | Veo 类 |
| 成本与迭代速度 | Kling 类 |
| 镜头控制与制作室 | Runway 类 |
| 从设计图动起来 | I2V 强的模型 |
| 对话/口型 | 原生音画+口型强的型号 |

---

# 6. 音频生成深挖（语音·音乐·音效）

## 6.1 三大子域

| 子域 | 简介 | 成熟度 |
|------|------|--------|
| **TTS / 语音克隆** | 文本→人声；少样本克隆 | ★★★★★ 商用 |
| **音乐生成** | 提示/歌词→歌曲 | ★★★★ 可听；商用法律敏感 |
| **音效 / 语音增强** | SFX、分离、降噪 | ★★★★ 工具成熟 |

---

## 6.2 语音（TTS & 克隆）

### 玩家快照

| 产品 | 简介 | 详细说明 |
|------|------|----------|
| **ElevenLabs** | 音质与克隆全能 | 多语言、配音、音效、进军音乐 |
| **Cartesia** | 超低延迟 | 实时语音 Agent；克隆快 |
| **OpenAI TTS** | 简单集成 | 预设声线；克隆能力有限/无公开完整克隆（视产品线） |
| **Azure / Google Cloud** | 企业语音 | 合规审查、定制声 |
| **开源** | XTTS、Kokoro 等 | 本地隐私 |

对比解读例：  
https://sureprompts.com/blog/voice-generation-models-compared-2026  
https://gradium.ai/content/best-text-to-speech-apis-2026  

### 能力表

| 能力 | 状态 |
|------|------|
| 自然度 | 短句极高 |
| 情感/表演 | 可控增强，长读物仍要调 |
| 实时 TTFB | 头部可到约 100ms 量级叙事 |
| 克隆 | 数秒～数分钟样本 |
| 多语言 | 头部强；小语种参差 |
| Agent 打断/对话 | Realtime API 生态 |

### 风险（语音特有）

| 风险 | 说明 |
|------|------|
| 声纹盗用 | 未授权克隆公众/私人 |
| 诈骗 | 仿领导/亲属 |
| 监管 | 多地深伪/数字副本立法 |

---

## 6.3 音乐生成

### 玩家快照

| 产品 | 简介 | 详细说明 |
|------|------|----------|
| **Suno** | 完整歌曲+人声标杆叙事 | 歌词曲风强；情感/「怪趣」 |
| **Udio** | 另一大消费向 | 与 Suno 双雄阶段 |
| **ElevenLabs Music** | 音质/声线背景切入 | 与语音产品协同；专业向叙事 |
| **Google Lyria** | 实时器乐等创新 | 研究/产品实验 |
| **Stable Audio 等** | 开源/API 音景 | 音效与器乐 |

对比解读例：  
https://www.teamday.ai/blog/best-ai-music-models-2026  
https://www.aimagicx.com/blog/suno-vs-udio-vs-elevenlabs-music-comparison-2026  
ElevenLabs Music 产品：https://elevenlabs.io/music  

### 能力与缺口

| 有 | 缺 |
|----|-----|
| 2–4 分钟可听成曲 | 精细编曲编辑器仍弱于 DAW |
| 多曲风、带词 | 商业发行版权灰色/诉讼 |
| 快速 BGM 草稿 | 与真实采样库的权利冲突史 |

### 详细说明

音乐是 **技术可用度** 与 **版权冲突** 最尖锐的模态之一：训练数据是否含受版权保护录音、输出能否商用、平台 ToS 是否indemnify——**上线前必须法务过一遍**。

---

## 6.4 音效与后处理

| 工具类型 | 用途 |
|----------|------|
| 文本→SFX | 脚步、环境、UI 音 |
| 音源分离 | 人声/伴奏分轨 |
| 降噪/修复 | 播客、现场 |
| 视频对轨 | 部分视频模型原生；否则后期 |

---

# 7. 跨模态工作流与选型指南

## 7.1 典型流水线

### A. 广告短片

| 步 | 工具类型 |
|----|----------|
| 1 策略与文案 | LLM |
| 2 关键视觉 | T2I / 品牌 LoRA |
| 3 动态 | I2V / T2V |
| 4 旁白 | TTS 品牌声 |
| 5 配乐 | 授权库 **或** AI 音乐（查权） |
| 6 剪辑合成 | 传统 NLE + 人 |

### B. 有声内容

| 步 | 工具 |
|----|------|
| 脚本 | LLM |
| 朗读 | TTS/克隆（授权） |
| 音乐床 | 授权 BGM |
| 母带 | 人/工具 |

### C. 游戏/互动

| 需求 | 取向 |
|------|------|
| 大量变体贴图 | 本地 SD/FLUX + 管线 |
| 过场预视 | 视频模型 |
| NPC 语音 | 实时 TTS |

## 7.2 一张选型总表

| 场景 | 图像 | 视频 | 音频 |
|------|------|------|------|
| 社媒日更 | MJ/FLUX | Kling/Veo 短 | TTS+库音乐 |
| 品牌主 KV | 可控开源微调 | 慎用纯 AI 成片 | 真人/授权 |
| 内部预演 | 任意 | 任意便宜 | 任意 |
| 实时语音机器人 | — | — | Cartesia/ElevenLabs 类 |
| 发行音乐专辑 | — | — | **律师+厂牌** 优先于 AI 独作 |

## 7.3 质量门禁（生产）

| 检查 | 说明 |
|------|------|
| 事实/标识错误 | 假 logo、假文字 |
| 人物权利 | 名人/员工/用户脸与声 |
| 一致性 | 多镜角色、产品 SKU |
| 物理崩坏 | 手、牙齿、物体穿透 |
| 许可 | 训练与输出 ToS、地区法 |
| 披露 | 是否需标 AI 生成 |

---

# 8. 版权·深伪·合规与伦理

## 8.1 简介

生成式媒体的 **硬约束** 往往不在 GPU，而在法律与平台。

## 8.2 美国版权取向（摘要）

| 点 | 说明 | 链接 |
|----|------|------|
| 著作权局 AI 专题 | 分部分报告：数字副本、可版权性等 | https://www.copyright.gov/ai/ |
| 输出可版权性 | 纯 AI、无足够人类创作贡献时，通常 **难获版权**（Part 2 等论述） | 同上 Part 2（2025-01 发布叙述） |
| 数字副本/深伪 | Part 1 强调未授权数字副本威胁，呼吁联邦层面保护 | 报告 PDF 见版权局站点 |

## 8.3 深伪与立法（摘要）

| 点 | 说明 |
|----|------|
| 亲密图像深伪 | 美国联邦 **TAKE IT DOWN Act**（2025）等要求平台处理非自愿性内容 |
| 州法 | 选举深伪、性深伪等多州立法扩张（2025–2026 追踪报道） |
| 趋势 | 从罚创作者 → 延伸平台/支付/托管责任；水印与 C2PA 溯源讨论 |

解读入口例：  
https://stackcyber.com/posts/ai-deepfake-laws  
https://www.multistate.us/insider/2026/2/12/how-ai-generated-content-laws-are-changing-across-the-country  

## 8.4 欧盟等

| 点 | 说明 |
|----|------|
| AI Act 等 | 高风险与透明义务（生成内容标识等，视最终适用） |
| 版权讨论 | 训练阶段与输出阶段权利平衡；纯 AI 输出不宜享版权等议会讨论 | 例：https://www.globalpolicywatch.com/2026/02/european-parliament-proposes-changes-to-copyright-protection-in-the-age-of-generative-ai/ |

## 8.5 伦理实践清单

| 做 | 不做 |
|----|------|
| 对人脸/声线要书面授权 | 未授权克隆真人或员工 |
| 政治广告遵守本地法 | 选举前匿名仿冒候选人 |
| 保留生成日志与提示 | 销毁审计后扯皮 |
| 敏感领域人审 | 全自动发布医疗/新闻画面 |

## 8.6 溯源技术

| 技术 | 简介 |
|------|------|
| C2PA / Content Credentials | 内容出处元数据 |
| 隐式水印 | 模型侧嵌入 |
| 检测器 | 深伪检测（军备竞赛，不可 100%） |

---

# 9. 产业·公司·商业模式

## 9.1 价值链

| 环 | 玩家类型 | 赚钱方式 |
|----|----------|----------|
| 基础模型 | BFL、Stability、大厂实验室 | API、订阅 |
| 创作套件 | MJ、Runway、Adobe Firefly | 订阅 |
| 云分发 | AWS/GCP/Azure、聚合 API | 算力差价 |
| 垂直应用 | 电商图、配音saas | 按张/分钟 |
| 数据与法务 | 授权图库、保险 | 授权费 |

## 9.2 商业模式表

| 模式 | 图像 | 视频 | 音频 |
|------|------|------|------|
| 订阅 | 常见 | 常见 | 常见 |
| 按次/按秒 | API | 按秒计费敏感 | TTS 按字符/分钟 |
| 企业私有化 | 开源+机房 | 较少 | 语音常见 |
| 市场/素材站 | 生成图上架争议 | 少 | 音乐发行争议大 |

## 9.3 与 Adobe / 设计工具

| 点 | 说明 |
|----|------|
| Firefly 等 | 强调「可商用训练数据」叙事，服务企业采购焦虑 |
| 插件化 | PS/PR/达芬奇工作流内嵌生成 |

---

# 10. 未来情景与时间线

## 10.1 情景表

| 时期 | 图像 | 视频 | 音频 |
|------|------|------|------|
| **2026–27** | 4K/可控标配；本地开源更强 | 原生 AV 普及；10–20s 精品 | 实时语音 Agent 默认；音乐授权产品化尝试 |
| **2027–29** | 设计系统级一致角色 | 分钟级叙事工具；更好物理 | 情感表演 TTS；配乐可编程度↑ |
| **2030 前后** | 与 3D/世界模型打通 | 「可导演讲戏」的交互生成 | 声纹权法律更严；检测常态 |

## 10.2 技术下一跳

| 候选 | 若成功 |
|------|--------|
| 统一音视频生成 | 一次出片 |
| 世界模型驱动镜头 | 物理更稳 |
| 可微编辑 / 层分离 | 像工程文件一样改 AI 片 |
| 强制溯源标准 | 平台互认水印 |

## 10.3 产业风险

| 风险 | 说明 |
|------|------|
| 版权诉讼集群 | 尤其音乐与图库 |
| 模型停服 | 如部分视频 API 生命周期短 |
| 算力成本 | 视频远贵于图 |
| 信任崩塌 | 深伪导致「眼见不为实」 |

---

# 11. 规划与四轮迭代过程

## 11.1 总规划

| 阶段 | 目标 |
|------|------|
| 规划 | 三模态+底座+合规+产业；双层文档 |
| 迭代 1 | 图像市场与模型格局 |
| 迭代 2 | 视频市场与能力边界 |
| 迭代 3 | 音频（语音+音乐） |
| 迭代 4 | 技术底座、版权深伪、Index、跨模态工作流 |
| 合成 | 本 MD |

## 11.2 四轮记录

### 迭代 1 — 图像

| 项 | 内容 |
|----|------|
| 检索 | FLUX、SD3.5、Midjourney、GPT Image、榜单 |
| 结论 | 开源（FLUX）与闭源并立；2K/4K 标配；SD 生态仍最可定制 |
| 代表链 | https://tech-insider.org/best-ai-image-generator-2026/ ；https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-models ；https://artificialanalysis.ai/image/leaderboard/text-to-image |

### 迭代 2 — 视频

| 项 | 内容 |
|----|------|
| 检索 | Veo、Kling、Sora、Runway、原生音频 |
| 结论 | 原生声画成标配趋势；性价比与企业向分化；Sora 产品生命周期需核验；长视频仍弱 |
| 代表链 | https://tech-insider.org/best-ai-video-generator-2026/ ；https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance ；https://video-zero-shot.github.io |

### 迭代 3 — 音频

| 项 | 内容 |
|----|------|
| 检索 | ElevenLabs、Suno、Udio、Cartesia、OpenAI TTS |
| 结论 | TTS/克隆商用最成熟；音乐可听但版权最刺；实时低延迟成语音 Agent 关键 |
| 代表链 | https://elevenlabs.io/music ；https://www.teamday.ai/blog/best-ai-music-models-2026 ；https://sureprompts.com/blog/voice-generation-models-compared-2026 |

### 迭代 4 — 底座·法务·总装

| 项 | 内容 |
|----|------|
| 检索 | DiT、扩散视频笔记、US Copyright AI、深伪法、Index 下载结构 |
| 结论 | DiT+潜空间主导视听生成；版权「纯 AI 难保护」；深伪立法加速；跨模态流水线是生产正解 |
| 代表链 | https://www.wpeebles.com/DiT.html ；https://lilianweng.github.io/posts/2024-04-12-diffusion-video/ ；https://www.copyright.gov/ai/ ；https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf |

## 11.3 续更模板（第 5 轮）

```
每月：
  [ ] 图像榜/新开源权重
  [ ] 视频旗舰版本与价格
  [ ] 音乐/TTS ToS 与诉讼
  [ ] 本国深伪与标识法规
写入：主张 | 日期 | 链接 | 是否影响生产选型
```

---

# 12. 学习路径

## 12.1 一周上手

| 天 | 动作 |
|----|------|
| 1 | 读 §0–§3 |
| 2 | 实战 20 张图：同一提示跨 2 个模型 |
| 3 | 实战 5 段视频：T2V vs I2V |
| 4 | TTS 克隆（仅用自己声音）+ 一段 AI 音乐草稿 |
| 5 | 串一条 15 秒广告流水线 |
| 6 | 读 §8 版权清单，改自己的发布规范 |
| 7 | 写内部选型一页纸 |

## 12.2 深潜

| 方向 | 材料 |
|------|------|
| 算法 | DiT 主页 + Weng 视频扩散笔记 |
| 工程 | ComfyUI 官方文档 + 一个视频 API |
| 法务 | copyright.gov/ai + 本公司律师 |
| 产业 | 每季重读 AI Index Technical 图像视频节 |

---

# 13. 链接总库

## 13.1 总览与评测

| 资源 | URL |
|------|-----|
| AI Index 2026 | https://hai.stanford.edu/ai-index/2026-ai-index-report |
| AI Index PDF | https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf |
| Technical Performance | https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance |
| Image Arena（榜） | https://artificialanalysis.ai/image/leaderboard/text-to-image |
| Video zero-shot 研究页 | https://video-zero-shot.github.io |

## 13.2 技术

| 资源 | URL |
|------|-----|
| DiT 项目页 | https://www.wpeebles.com/DiT.html |
| Lilian Weng 视频扩散 | https://lilianweng.github.io/posts/2024-04-12-diffusion-video/ |
| DiT 入门解读 | https://encord.com/blog/diffusion-models-with-transformers/ |

## 13.3 图像产业解读

| 资源 | URL |
|------|-----|
| 2026 图像生成器对比 | https://tech-insider.org/best-ai-image-generator-2026/ |
| 开源图像模型指南 | https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-models |
| Stability SD3.5 信息 | https://stability.ai/news-updates/introducing-stable-diffusion-3-5 |

## 13.4 视频产业解读

| 资源 | URL |
|------|-----|
| 2026 视频生成器对比 | https://tech-insider.org/best-ai-video-generator-2026/ |
| Sora/Veo/Kling 等比较 | https://lushbinary.com/blog/ai-video-generation-sora-veo-kling-seedance-comparison/ |

## 13.5 音频

| 资源 | URL |
|------|-----|
| ElevenLabs Music | https://elevenlabs.io/music |
| 音乐模型 2026 | https://www.teamday.ai/blog/best-ai-music-models-2026 |
| Suno vs Udio vs ElevenLabs | https://www.aimagicx.com/blog/suno-vs-udio-vs-elevenlabs-music-comparison-2026 |
| 语音模型对比 2026 | https://sureprompts.com/blog/voice-generation-models-compared-2026 |
| TTS API 指南 | https://gradium.ai/content/best-text-to-speech-apis-2026 |

## 13.6 法律

| 资源 | URL |
|------|-----|
| US Copyright Office AI | https://www.copyright.gov/ai/ |
| 深伪立法追踪例 | https://stackcyber.com/posts/ai-deepfake-laws |
| 州级 AI 内容法变化 | https://www.multistate.us/insider/2026/2/12/how-ai-generated-content-laws-are-changing-across-the-country |

---

# 14. 诚实边界

| 项目 | 说明 |
|------|------|
| 产品名/版本/价格/Elo | **强时效**；文中为 2026 中调研快照 |
| 产业博客 | 多用于地图与共识，**不等于**同行评审 |
| Sora 等存续 | 必须以厂商官网/帮助中心为准 |
| 法律 | 非律师意见；跨境务必本地合规 |
| 未深测 | 未在本文做统一盲测打分；请自建评测集 |
| 中国产品细节 | 有 Kling 等；完整国产矩阵需另开区域迭代 |

---

# 附录：一页纸作弊条

```
图像：最成熟。FLUX/SD 开源可控；MJ 美学；2K/4K 标配。
视频：短片可用；原生声画成趋势；长片靠剪；物理仍崩。
语音：TTS/克隆商用就绪；实时低延迟拼 Agent。
音乐：好听但版权最雷；商用先律师。
技术：潜空间扩散 + DiT 是视听主干。
生产：LLM 脚本 → 静帧定调 → I2V/T2V → 人剪 → 合规。
法律：纯 AI 输出版权弱；深伪立法加强；要授权要日志。
选型：要生态用 SD；要听指令开源试 FLUX；要企业视频看 Veo/Runway；要便宜运动看 Kling。
别做：未授权换脸换声；只信一个榜；无审发关键新闻画面。
更新：每月看版本与 ToS；每季重读 AI Index 图像视频节。
```

---

**文档结束**

**路径**：`D:\AI\量子\AI生成式媒体_图像视频音频_认知手册.md`  

**建议读序**：§0 → §3 → 按需 §4/§5/§6 → §7–§8 → 收藏 §13。
