WebMD
本页大纲

AI 生成式媒体全面认知手册

生图 · 视频 · 音频(含音乐/语音)

目标:对 AI 生成图像、视频、音频(语音/音乐/音效) 建立全面认知——5 分钟总览,也可下钻技术、产品、版权与工作流。
方法:规划 → 4 轮迭代调研 → 合成双层文档(简介表 + 详细说明 + 可追溯链接)。
日期:2026-07-13
注意:生成式产品版本与榜分 周级变化;选型以你实测与官网当日为准。文中具体型号为调研时点的产业共识快照。

姊妹文档

  • 纯AI领域全面认知手册.md(语言/Agent 等)
  • AI与量子计算_全面认知手册.md

阅读导航

时间 读什么
5 分钟 §0 总览 + 附录作弊条
30 分钟 §0–§3 + §7 选型 + §8 风险
深挖图像 §4
深挖视频 §5
深挖音频 §6
方法复用 §11 四轮迭代记录

目录

  1. 五分钟总览
  2. 概念词典与模态地图
  3. 技术底座:扩散 · DiT · 潜空间 · 自回归
  4. 现状全景:三模态对照
  5. 图像生成深挖
  6. 视频生成深挖
  7. 音频生成深挖(语音·音乐·音效)
  8. 跨模态工作流与选型指南
  9. 版权·深伪·合规与伦理
  10. 产业·公司·商业模式
  11. 未来情景与时间线
  12. 规划与四轮迭代过程
  13. 学习路径
  14. 链接总库
  15. 诚实边界
    附录:一页纸作弊条

0. 五分钟总览

0.1 简介

生成式媒体已从「好玩 demo」进入 生产素材流水线:静帧基本可用、短视频快速可用但仍不稳、语音极成熟、音乐「能听」但版权与版权方博弈激烈。

0.2 三模态一句话

模态 现在什么水平 还差什么 你现在怎么用
图像 最高成熟:2K/4K、可控、开源生态全 品牌一致性、复杂排版、法律清晰度 概念/营销/电商主图,人审关键视觉
视频 秒~十几秒高质量片段;多模型原生声画 长镜头一致性、可控剪辑、物理偶崩 广告分镜、社媒短片、预可视化
音频-语音 TTS/克隆接近商用广播 情感长程、防滥用 配音、有声书、语音 Agent
音频-音乐 完整歌曲可听 版权诉讼、可编辑性、专业母带 草稿/BGM;商用要查授权

0.3 与「大模型聊天」的关系

角色
语言模型 / 多模态 LLM 写提示、改脚本、分镜、审片
专用生成模型 真正出像素/波形
Agent / 工作流 批量、版本、品牌库、合规检查

0.4 生态结构(文字图)

提示 / 参考图 / 音频条件
        │
        ▼
┌───────────────────┐
│  专用生成模型栈     │  图像 DiT/扩散 · 视频时空 DiT · 音频扩散/编解码
└─────────┬─────────┘
          │
    ┌─────┼─────┐
    ▼     ▼     ▼
  静帧   短视频  语音/曲
    │     │     │
    └─────┴─────┘
          │
    剪辑·合成·配乐·字幕·发布
          │
    版权·水印·深伪检测·平台政策

0.5 Index 侧旁证(下载与能力)

Stanford HAI AI Index 2026 相关取向:

说明
下载结构 Hugging Face 热门中,文本生成占比高;图像生成 为重要第二类;视频生成份额上升但仍小于图像(报告图示量级:文生约 42%、图像约 26%、多模态约 13%、视频约 5% 等——以 PDF 为准)
能力 视频生成开始出现「像会物理直觉」的零样本行为叙述(如 Veo 相关 zero-shot 研究)
短板 Index 仍将 连贯真实视频 等列为相对落后任务族之一

1. 概念词典与模态地图

1.1 生成任务类型

任务 输入 输出 简介
T2I 文本 图像 文生图
I2I 图+文本 图像 改图、风格、局部
T2V 文本 视频 文生视频
I2V 图+文本 视频 图生视频(常更可控)
V2V 视频+条件 视频 风格/运动迁移
TTS 文本 语音 文本转语音
STS / 克隆 参考声+文本 语音 声音复刻
T2M 文本/歌词 音乐 文生曲/带唱
音效 文本/视频 SFX 环境声、拟音
AV 联合 文本/多模态 视频+音轨 原生声画一体

1.2 控制与质量术语

术语 简介 详细说明
Prompt adherence 听不听话 提示词还原度
Identity consistency 角色一致性 同人多镜是否像同一人
Temporal consistency 时间一致 视频帧间闪烁、形变
Controllability 可控性 ControlNet、相机、遮罩、参考
LoRA / Fine-tune 小样本定制 品牌、角色、画风
Upscale 超分 提分辨率;优质模型原生 2K/4K 减少依赖
Latent space 潜空间 压缩后再扩散,省算力
CFG / 采样步数 引导与步数 质量-速度权衡
Watermark / C2PA 来源标记 溯源与合规
Deepfake 深度伪造 仿人脸/声线滥用风险

1.3 闭源 API vs 开源本地

闭源云 开源/可自托管
质量峰值 常领先或并列 FLUX 等已逼近/局部超越
定制 有限 LoRA/ComfyUI 极强
成本结构 按张/秒/分钟 GPU 与电
合规 服务条款清晰度不一 训练数据与输出权责自担
适合 快速上线、企业采购 隐私、批量、垂直微调

2. 技术底座:扩散 · DiT · 潜空间 · 自回归

2.1 简介

懂底座才能判断「下一代会卡在哪」。

2.2 扩散模型(Diffusion)

步骤 简介
训练 学「从噪声还原数据」
推理 从随机噪声多步去噪成图/视频/频谱
优势 画质高、多样性好
代价 步数多则慢(有蒸馏加速)

经典潜空间扩散(LDM)思路:先 VAE 压到潜空间再扩散——Stable Diffusion 族核心。

2.3 Diffusion Transformer(DiT)

说明
是什么 Transformer 替换扩散里的 U-Net 骨干
为何重要 更易缩放;成 2024–2026 图像/视频主流架构之一
视频 在时空 patch / 潜空间 token 上做注意力(Sora 类「时空补丁」叙事)
入门论文 Peebles & Xie, Scalable Diffusion Models with Transformershttps://www.wpeebles.com/DiT.html
视频综述笔记 Lilian Weng 扩散视频:https://lilianweng.github.io/posts/2024-04-12-diffusion-video/

2.4 其他范式(简介)

范式 用在 简介
自回归视觉 部分图/视频 像 LLM 一样预测下一 token;与扩散竞争/混合
流匹配 / 一致性模型 加速生成 少步甚至单步
编解码音频 (codec LM) 音乐/语音 离散音频 token + 语言模型
声码器/神经编解码 TTS 声学特征 → 波形

2.5 视频比图像难在哪

难点 简介
时间维 帧间一致、运动合理
算力 分辨率×帧数爆炸
物理 流体、碰撞、手-物
可控剪辑 分镜、镜头语言
声画同步 口型、环境声

Index 取向:视频模型开始展现部分 zero-shot 物理/推理 迹象,但「全程连贯真实长视频」仍是公认难关。
技术章:https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance


3. 现状全景:三模态对照

3.1 成熟度雷达(2026 中主观标尺)

维度(1–5) 图像 视频 语音 TTS 音乐
默认可用质量 5 3.5–4 5 3.5–4
可控/可编辑 4.5 3 4 2.5–3
开源生态 5 3 3.5 2.5
商用法律清晰 3 3 3 2
实时/低延迟 4 2–3 5(部分 <100ms) 2–3
长内容 5(单图) 2(长片) 4 3(整曲可)

3.2 能力跃迁时间线(粗)

图像 视频 音频
2022–23 SD 爆火、MJ 美学 短、糊、闪 早期音乐 demo;TTS 商用化
2024 SD3/FLUX 崛起 Sora 示范、Runway/Kling 等军备 Suno/Udio 爆款;克隆语音普及
2025–26 2K/4K 标配、多参考、开源逼近闭源 原生音画、10s 级精品、企业工具链 ElevenLabs 进军音乐;实时 TTS 军备

4. 图像生成深挖

4.1 简介

最成熟的生成模态:营销、电商、概念设计、游戏原画流水线已日常使用。

4.2 玩家与定位(快照,会变)

产品/模型族 类型 简介(产业共识取向) 详细说明
Midjourney 闭源 美学/艺术向强 设计师喜爱;社区与风格感
FLUX 族 (Black Forest Labs) 开源权重 + API 开源侧画质与听指令标杆 pro/flex API;dev 等可自托管;多参考、高分辨率叙事
Stable Diffusion 3.5 开源生态 工具链最广 ComfyUI/LoRA/ControlNet 生态;许可注意营收门槛
OpenAI 图像 (GPT Image 等) 闭源 聊天集成、部分榜领先叙事 易用;与 ChatGPT 工作流一体
Google 图像 (Imagen / 产品侧 Nano Banana 等命名) 闭源 高分辨率、生态集成 与 Gemini/搜索生态
Ideogram 等 闭源 文字渲染 海报字较好的细分
Recraft 等 闭源 设计系统/矢量向 品牌与 UI 资产

行业对比解读例(非论文,作地图):
https://tech-insider.org/best-ai-image-generator-2026/
开源列表例:https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-models

排行榜参考(变化快):Artificial Analysis Image Arena 等
https://artificialanalysis.ai/image/leaderboard/text-to-image

4.3 能力清单(2026)

能力 状态 说明
原生 2K/4K 高端标配 减少「先糊后超分」
提示词遵循 显著提升 FLUX 等以 adherence 著称
图中文字 改善但仍挑模型 Ideogram 等细分
多参考/角色一致 可用 品牌角色仍要微调或工作流
ControlNet/姿态/深度 开源极强 生产控制主力
局部重绘 inpaint 成熟 修图工作流
批量 API 成熟 电商 SKU

4.4 工作流组件

组件 简介
ComfyUI / Forge 等 节点式本地流水线
LoRA / DreamBooth 人/产品/风格
IP-Adapter / 参考 保持主体
放大/修脸/细节 后处理
素材库 + 元数据 版本与版权记录

4.5 选型简表

你的需求 更可能优先试
最美概念艺术 Midjourney 类
听指令 + 可自托管 FLUX dev/开源族
最大插件生态 SD 3.5 + ComfyUI
和 GPT 一起改图 OpenAI 图像
海报汉字/字母 专测文字模型
企业 SLA 云厂商合同产品

5. 视频生成深挖

5.1 简介

2025–2026:短视频精品化 + 原生音频 是主跃迁;长片叙事与镜头级剪辑仍靠人+工具。

5.2 玩家与定位(快照)

产品 简介(产业共识取向) 详细说明 / 注意
Google Veo (+ Flow 等创作壳) 电影感、企业安全叙事、原生音画 常被当作「精品/企业」首选之一
Kling (快手) 性价比、运动、口型/角色向功能 多评测称「大众最优性价比」
Runway 创作工作区 + 生成 控制与剪辑向;制作团队友好
OpenAI Sora 物理/运动标杆叙事 有产品线收缩/停服时间表的产业报道——部署前必查官网现状
Luma Dream Machine 运动自然、I2V 概念到动态
Pika 等 轻量、玩法 入门与特效
Seedance 等 声画联合、口型 对话镜头向

对比解读例:
https://tech-insider.org/best-ai-video-generator-2026/
https://lushbinary.com/blog/ai-video-generation-sora-veo-kling-seedance-comparison/

重要:Sora 消费端/API 停用时间表以 OpenAI 官方帮助中心为准(产业文多有引用,请核验):
检索 OpenAI Sora discontinuation 或 help.openai.com。

5.3 能力清单(2026)

能力 状态 说明
5–15 秒精品 常用 广告、社媒
原生同步音频 多旗舰支持 减后期配音步骤
1080p / 部分 4K 分层 看套餐
I2V 可控 常优于纯 T2V 先定构图
口型/角色 进步快 仍有崩
物理合理性 改善 手、文字、长程仍翻车
镜头语言 部分提示可用 专业摄影需试
长视频故事 分段生成+剪辑

5.4 Index 技术点(视频)

AI Index Technical 叙述例:Veo 3 在大规模生成测试中展现浮力、迷宫等 未专门训练任务上的行为,被讨论为「视频模型作为 zero-shot 学习者」方向。
来源页:https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
相关研究入口:https://video-zero-shot.github.io

5.5 生产工作流(推荐心智)

剧本/分镜(LLM)
  → 关键帧静图(T2I,定角色与光)
  → I2V / T2V 出镜头
  → 不合格镜重生或 Runway 类工具修
  → 人剪 + 配乐/对白修
  → 合规水印与发布

5.6 选型简表

需求 优先取向
电影感精品短片 Veo 类
成本与迭代速度 Kling 类
镜头控制与制作室 Runway 类
从设计图动起来 I2V 强的模型
对话/口型 原生音画+口型强的型号

6. 音频生成深挖(语音·音乐·音效)

6.1 三大子域

子域 简介 成熟度
TTS / 语音克隆 文本→人声;少样本克隆 ★★★★★ 商用
音乐生成 提示/歌词→歌曲 ★★★★ 可听;商用法律敏感
音效 / 语音增强 SFX、分离、降噪 ★★★★ 工具成熟

6.2 语音(TTS & 克隆)

玩家快照

产品 简介 详细说明
ElevenLabs 音质与克隆全能 多语言、配音、音效、进军音乐
Cartesia 超低延迟 实时语音 Agent;克隆快
OpenAI TTS 简单集成 预设声线;克隆能力有限/无公开完整克隆(视产品线)
Azure / Google Cloud 企业语音 合规审查、定制声
开源 XTTS、Kokoro 等 本地隐私

对比解读例:
https://sureprompts.com/blog/voice-generation-models-compared-2026
https://gradium.ai/content/best-text-to-speech-apis-2026

能力表

能力 状态
自然度 短句极高
情感/表演 可控增强,长读物仍要调
实时 TTFB 头部可到约 100ms 量级叙事
克隆 数秒~数分钟样本
多语言 头部强;小语种参差
Agent 打断/对话 Realtime API 生态

风险(语音特有)

风险 说明
声纹盗用 未授权克隆公众/私人
诈骗 仿领导/亲属
监管 多地深伪/数字副本立法

6.3 音乐生成

玩家快照

产品 简介 详细说明
Suno 完整歌曲+人声标杆叙事 歌词曲风强;情感/「怪趣」
Udio 另一大消费向 与 Suno 双雄阶段
ElevenLabs Music 音质/声线背景切入 与语音产品协同;专业向叙事
Google Lyria 实时器乐等创新 研究/产品实验
Stable Audio 等 开源/API 音景 音效与器乐

对比解读例:
https://www.teamday.ai/blog/best-ai-music-models-2026
https://www.aimagicx.com/blog/suno-vs-udio-vs-elevenlabs-music-comparison-2026
ElevenLabs Music 产品:https://elevenlabs.io/music

能力与缺口

2–4 分钟可听成曲 精细编曲编辑器仍弱于 DAW
多曲风、带词 商业发行版权灰色/诉讼
快速 BGM 草稿 与真实采样库的权利冲突史

详细说明

音乐是 技术可用度版权冲突 最尖锐的模态之一:训练数据是否含受版权保护录音、输出能否商用、平台 ToS 是否indemnify——上线前必须法务过一遍


6.4 音效与后处理

工具类型 用途
文本→SFX 脚步、环境、UI 音
音源分离 人声/伴奏分轨
降噪/修复 播客、现场
视频对轨 部分视频模型原生;否则后期

7. 跨模态工作流与选型指南

7.1 典型流水线

A. 广告短片

工具类型
1 策略与文案 LLM
2 关键视觉 T2I / 品牌 LoRA
3 动态 I2V / T2V
4 旁白 TTS 品牌声
5 配乐 授权库 AI 音乐(查权)
6 剪辑合成 传统 NLE + 人

B. 有声内容

工具
脚本 LLM
朗读 TTS/克隆(授权)
音乐床 授权 BGM
母带 人/工具

C. 游戏/互动

需求 取向
大量变体贴图 本地 SD/FLUX + 管线
过场预视 视频模型
NPC 语音 实时 TTS

7.2 一张选型总表

场景 图像 视频 音频
社媒日更 MJ/FLUX Kling/Veo 短 TTS+库音乐
品牌主 KV 可控开源微调 慎用纯 AI 成片 真人/授权
内部预演 任意 任意便宜 任意
实时语音机器人 Cartesia/ElevenLabs 类
发行音乐专辑 律师+厂牌 优先于 AI 独作

7.3 质量门禁(生产)

检查 说明
事实/标识错误 假 logo、假文字
人物权利 名人/员工/用户脸与声
一致性 多镜角色、产品 SKU
物理崩坏 手、牙齿、物体穿透
许可 训练与输出 ToS、地区法
披露 是否需标 AI 生成

8. 版权·深伪·合规与伦理

8.1 简介

生成式媒体的 硬约束 往往不在 GPU,而在法律与平台。

8.2 美国版权取向(摘要)

说明 链接
著作权局 AI 专题 分部分报告:数字副本、可版权性等 https://www.copyright.gov/ai/
输出可版权性 纯 AI、无足够人类创作贡献时,通常 难获版权(Part 2 等论述) 同上 Part 2(2025-01 发布叙述)
数字副本/深伪 Part 1 强调未授权数字副本威胁,呼吁联邦层面保护 报告 PDF 见版权局站点

8.3 深伪与立法(摘要)

说明
亲密图像深伪 美国联邦 TAKE IT DOWN Act(2025)等要求平台处理非自愿性内容
州法 选举深伪、性深伪等多州立法扩张(2025–2026 追踪报道)
趋势 从罚创作者 → 延伸平台/支付/托管责任;水印与 C2PA 溯源讨论

解读入口例:
https://stackcyber.com/posts/ai-deepfake-laws
https://www.multistate.us/insider/2026/2/12/how-ai-generated-content-laws-are-changing-across-the-country

8.4 欧盟等

说明
AI Act 等 高风险与透明义务(生成内容标识等,视最终适用)
版权讨论 训练阶段与输出阶段权利平衡;纯 AI 输出不宜享版权等议会讨论

8.5 伦理实践清单

不做
对人脸/声线要书面授权 未授权克隆真人或员工
政治广告遵守本地法 选举前匿名仿冒候选人
保留生成日志与提示 销毁审计后扯皮
敏感领域人审 全自动发布医疗/新闻画面

8.6 溯源技术

技术 简介
C2PA / Content Credentials 内容出处元数据
隐式水印 模型侧嵌入
检测器 深伪检测(军备竞赛,不可 100%)

9. 产业·公司·商业模式

9.1 价值链

玩家类型 赚钱方式
基础模型 BFL、Stability、大厂实验室 API、订阅
创作套件 MJ、Runway、Adobe Firefly 订阅
云分发 AWS/GCP/Azure、聚合 API 算力差价
垂直应用 电商图、配音saas 按张/分钟
数据与法务 授权图库、保险 授权费

9.2 商业模式表

模式 图像 视频 音频
订阅 常见 常见 常见
按次/按秒 API 按秒计费敏感 TTS 按字符/分钟
企业私有化 开源+机房 较少 语音常见
市场/素材站 生成图上架争议 音乐发行争议大

9.3 与 Adobe / 设计工具

说明
Firefly 等 强调「可商用训练数据」叙事,服务企业采购焦虑
插件化 PS/PR/达芬奇工作流内嵌生成

10. 未来情景与时间线

10.1 情景表

时期 图像 视频 音频
2026–27 4K/可控标配;本地开源更强 原生 AV 普及;10–20s 精品 实时语音 Agent 默认;音乐授权产品化尝试
2027–29 设计系统级一致角色 分钟级叙事工具;更好物理 情感表演 TTS;配乐可编程度↑
2030 前后 与 3D/世界模型打通 「可导演讲戏」的交互生成 声纹权法律更严;检测常态

10.2 技术下一跳

候选 若成功
统一音视频生成 一次出片
世界模型驱动镜头 物理更稳
可微编辑 / 层分离 像工程文件一样改 AI 片
强制溯源标准 平台互认水印

10.3 产业风险

风险 说明
版权诉讼集群 尤其音乐与图库
模型停服 如部分视频 API 生命周期短
算力成本 视频远贵于图
信任崩塌 深伪导致「眼见不为实」

11. 规划与四轮迭代过程

11.1 总规划

阶段 目标
规划 三模态+底座+合规+产业;双层文档
迭代 1 图像市场与模型格局
迭代 2 视频市场与能力边界
迭代 3 音频(语音+音乐)
迭代 4 技术底座、版权深伪、Index、跨模态工作流
合成 本 MD

11.2 四轮记录

迭代 1 — 图像

内容
检索 FLUX、SD3.5、Midjourney、GPT Image、榜单
结论 开源(FLUX)与闭源并立;2K/4K 标配;SD 生态仍最可定制
代表链 https://tech-insider.org/best-ai-image-generator-2026/https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-modelshttps://artificialanalysis.ai/image/leaderboard/text-to-image

迭代 2 — 视频

内容
检索 Veo、Kling、Sora、Runway、原生音频
结论 原生声画成标配趋势;性价比与企业向分化;Sora 产品生命周期需核验;长视频仍弱
代表链 https://tech-insider.org/best-ai-video-generator-2026/https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performancehttps://video-zero-shot.github.io

迭代 3 — 音频

内容
检索 ElevenLabs、Suno、Udio、Cartesia、OpenAI TTS
结论 TTS/克隆商用最成熟;音乐可听但版权最刺;实时低延迟成语音 Agent 关键
代表链 https://elevenlabs.io/musichttps://www.teamday.ai/blog/best-ai-music-models-2026https://sureprompts.com/blog/voice-generation-models-compared-2026

迭代 4 — 底座·法务·总装

内容
检索 DiT、扩散视频笔记、US Copyright AI、深伪法、Index 下载结构
结论 DiT+潜空间主导视听生成;版权「纯 AI 难保护」;深伪立法加速;跨模态流水线是生产正解
代表链 https://www.wpeebles.com/DiT.htmlhttps://lilianweng.github.io/posts/2024-04-12-diffusion-video/https://www.copyright.gov/ai/https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf

11.3 续更模板(第 5 轮)

每月:
  [ ] 图像榜/新开源权重
  [ ] 视频旗舰版本与价格
  [ ] 音乐/TTS ToS 与诉讼
  [ ] 本国深伪与标识法规
写入:主张 | 日期 | 链接 | 是否影响生产选型

12. 学习路径

12.1 一周上手

动作
1 读 §0–§3
2 实战 20 张图:同一提示跨 2 个模型
3 实战 5 段视频:T2V vs I2V
4 TTS 克隆(仅用自己声音)+ 一段 AI 音乐草稿
5 串一条 15 秒广告流水线
6 读 §8 版权清单,改自己的发布规范
7 写内部选型一页纸

12.2 深潜

方向 材料
算法 DiT 主页 + Weng 视频扩散笔记
工程 ComfyUI 官方文档 + 一个视频 API
法务 copyright.gov/ai + 本公司律师
产业 每季重读 AI Index Technical 图像视频节

13. 链接总库

13.1 总览与评测

资源 URL
AI Index 2026 https://hai.stanford.edu/ai-index/2026-ai-index-report
AI Index PDF https://hai.stanford.edu/assets/files/ai_index_report_2026.pdf
Technical Performance https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
Image Arena(榜) https://artificialanalysis.ai/image/leaderboard/text-to-image
Video zero-shot 研究页 https://video-zero-shot.github.io

13.2 技术

资源 URL
DiT 项目页 https://www.wpeebles.com/DiT.html
Lilian Weng 视频扩散 https://lilianweng.github.io/posts/2024-04-12-diffusion-video/
DiT 入门解读 https://encord.com/blog/diffusion-models-with-transformers/

13.3 图像产业解读

资源 URL
2026 图像生成器对比 https://tech-insider.org/best-ai-image-generator-2026/
开源图像模型指南 https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-models
Stability SD3.5 信息 https://stability.ai/news-updates/introducing-stable-diffusion-3-5

13.4 视频产业解读

资源 URL
2026 视频生成器对比 https://tech-insider.org/best-ai-video-generator-2026/
Sora/Veo/Kling 等比较 https://lushbinary.com/blog/ai-video-generation-sora-veo-kling-seedance-comparison/

13.5 音频

资源 URL
ElevenLabs Music https://elevenlabs.io/music
音乐模型 2026 https://www.teamday.ai/blog/best-ai-music-models-2026
Suno vs Udio vs ElevenLabs https://www.aimagicx.com/blog/suno-vs-udio-vs-elevenlabs-music-comparison-2026
语音模型对比 2026 https://sureprompts.com/blog/voice-generation-models-compared-2026
TTS API 指南 https://gradium.ai/content/best-text-to-speech-apis-2026

13.6 法律

资源 URL
US Copyright Office AI https://www.copyright.gov/ai/
深伪立法追踪例 https://stackcyber.com/posts/ai-deepfake-laws
州级 AI 内容法变化 https://www.multistate.us/insider/2026/2/12/how-ai-generated-content-laws-are-changing-across-the-country

14. 诚实边界

项目 说明
产品名/版本/价格/Elo 强时效;文中为 2026 中调研快照
产业博客 多用于地图与共识,不等于同行评审
Sora 等存续 必须以厂商官网/帮助中心为准
法律 非律师意见;跨境务必本地合规
未深测 未在本文做统一盲测打分;请自建评测集
中国产品细节 有 Kling 等;完整国产矩阵需另开区域迭代

附录:一页纸作弊条

图像:最成熟。FLUX/SD 开源可控;MJ 美学;2K/4K 标配。
视频:短片可用;原生声画成趋势;长片靠剪;物理仍崩。
语音:TTS/克隆商用就绪;实时低延迟拼 Agent。
音乐:好听但版权最雷;商用先律师。
技术:潜空间扩散 + DiT 是视听主干。
生产:LLM 脚本 → 静帧定调 → I2V/T2V → 人剪 → 合规。
法律:纯 AI 输出版权弱;深伪立法加强;要授权要日志。
选型:要生态用 SD;要听指令开源试 FLUX;要企业视频看 Veo/Runway;要便宜运动看 Kling。
别做:未授权换脸换声;只信一个榜;无审发关键新闻画面。
更新:每月看版本与 ToS;每季重读 AI Index 图像视频节。

文档结束

路径D:\AI\量子\AI生成式媒体_图像视频音频_认知手册.md

建议读序:§0 → §3 → 按需 §4/§5/§6 → §7–§8 → 收藏 §13。