AI 生成式媒体全面认知手册
生图 · 视频 · 音频(含音乐/语音)
目标:对 AI 生成图像、视频、音频(语音/音乐/音效) 建立全面认知——5 分钟总览,也可下钻技术、产品、版权与工作流。
方法:规划 → 4 轮迭代调研 → 合成双层文档(简介表 + 详细说明 + 可追溯链接)。
日期:2026-07-13
注意:生成式产品版本与榜分 周级变化;选型以你实测与官网当日为准。文中具体型号为调研时点的产业共识快照。
姊妹文档
纯AI领域全面认知手册.md(语言/Agent 等)
AI与量子计算_全面认知手册.md
阅读导航
目录
- 五分钟总览
- 概念词典与模态地图
- 技术底座:扩散 · DiT · 潜空间 · 自回归
- 现状全景:三模态对照
- 图像生成深挖
- 视频生成深挖
- 音频生成深挖(语音·音乐·音效)
- 跨模态工作流与选型指南
- 版权·深伪·合规与伦理
- 产业·公司·商业模式
- 未来情景与时间线
- 规划与四轮迭代过程
- 学习路径
- 链接总库
- 诚实边界
附录:一页纸作弊条
0. 五分钟总览
0.1 简介
生成式媒体已从「好玩 demo」进入 生产素材流水线:静帧基本可用、短视频快速可用但仍不稳、语音极成熟、音乐「能听」但版权与版权方博弈激烈。
0.2 三模态一句话
| 模态 |
现在什么水平 |
还差什么 |
你现在怎么用 |
| 图像 |
最高成熟:2K/4K、可控、开源生态全 |
品牌一致性、复杂排版、法律清晰度 |
概念/营销/电商主图,人审关键视觉 |
| 视频 |
秒~十几秒高质量片段;多模型原生声画 |
长镜头一致性、可控剪辑、物理偶崩 |
广告分镜、社媒短片、预可视化 |
| 音频-语音 |
TTS/克隆接近商用广播 |
情感长程、防滥用 |
配音、有声书、语音 Agent |
| 音频-音乐 |
完整歌曲可听 |
版权诉讼、可编辑性、专业母带 |
草稿/BGM;商用要查授权 |
0.3 与「大模型聊天」的关系
| 层 |
角色 |
| 语言模型 / 多模态 LLM |
写提示、改脚本、分镜、审片 |
| 专用生成模型 |
真正出像素/波形 |
| Agent / 工作流 |
批量、版本、品牌库、合规检查 |
0.4 生态结构(文字图)
提示 / 参考图 / 音频条件
│
▼
┌───────────────────┐
│ 专用生成模型栈 │ 图像 DiT/扩散 · 视频时空 DiT · 音频扩散/编解码
└─────────┬─────────┘
│
┌─────┼─────┐
▼ ▼ ▼
静帧 短视频 语音/曲
│ │ │
└─────┴─────┘
│
剪辑·合成·配乐·字幕·发布
│
版权·水印·深伪检测·平台政策
0.5 Index 侧旁证(下载与能力)
Stanford HAI AI Index 2026 相关取向:
| 点 |
说明 |
| 下载结构 |
Hugging Face 热门中,文本生成占比高;图像生成 为重要第二类;视频生成份额上升但仍小于图像(报告图示量级:文生约 42%、图像约 26%、多模态约 13%、视频约 5% 等——以 PDF 为准) |
| 能力 |
视频生成开始出现「像会物理直觉」的零样本行为叙述(如 Veo 相关 zero-shot 研究) |
| 短板 |
Index 仍将 连贯真实视频 等列为相对落后任务族之一 |
1. 概念词典与模态地图
1.1 生成任务类型
| 任务 |
输入 |
输出 |
简介 |
| T2I |
文本 |
图像 |
文生图 |
| I2I |
图+文本 |
图像 |
改图、风格、局部 |
| T2V |
文本 |
视频 |
文生视频 |
| I2V |
图+文本 |
视频 |
图生视频(常更可控) |
| V2V |
视频+条件 |
视频 |
风格/运动迁移 |
| TTS |
文本 |
语音 |
文本转语音 |
| STS / 克隆 |
参考声+文本 |
语音 |
声音复刻 |
| T2M |
文本/歌词 |
音乐 |
文生曲/带唱 |
| 音效 |
文本/视频 |
SFX |
环境声、拟音 |
| AV 联合 |
文本/多模态 |
视频+音轨 |
原生声画一体 |
1.2 控制与质量术语
| 术语 |
简介 |
详细说明 |
| Prompt adherence |
听不听话 |
提示词还原度 |
| Identity consistency |
角色一致性 |
同人多镜是否像同一人 |
| Temporal consistency |
时间一致 |
视频帧间闪烁、形变 |
| Controllability |
可控性 |
ControlNet、相机、遮罩、参考 |
| LoRA / Fine-tune |
小样本定制 |
品牌、角色、画风 |
| Upscale |
超分 |
提分辨率;优质模型原生 2K/4K 减少依赖 |
| Latent space |
潜空间 |
压缩后再扩散,省算力 |
| CFG / 采样步数 |
引导与步数 |
质量-速度权衡 |
| Watermark / C2PA |
来源标记 |
溯源与合规 |
| Deepfake |
深度伪造 |
仿人脸/声线滥用风险 |
1.3 闭源 API vs 开源本地
|
闭源云 |
开源/可自托管 |
| 质量峰值 |
常领先或并列 |
FLUX 等已逼近/局部超越 |
| 定制 |
有限 |
LoRA/ComfyUI 极强 |
| 成本结构 |
按张/秒/分钟 |
GPU 与电 |
| 合规 |
服务条款清晰度不一 |
训练数据与输出权责自担 |
| 适合 |
快速上线、企业采购 |
隐私、批量、垂直微调 |
2. 技术底座:扩散 · DiT · 潜空间 · 自回归
2.1 简介
懂底座才能判断「下一代会卡在哪」。
2.2 扩散模型(Diffusion)
| 步骤 |
简介 |
| 训练 |
学「从噪声还原数据」 |
| 推理 |
从随机噪声多步去噪成图/视频/频谱 |
| 优势 |
画质高、多样性好 |
| 代价 |
步数多则慢(有蒸馏加速) |
经典潜空间扩散(LDM)思路:先 VAE 压到潜空间再扩散——Stable Diffusion 族核心。
2.4 其他范式(简介)
| 范式 |
用在 |
简介 |
| 自回归视觉 |
部分图/视频 |
像 LLM 一样预测下一 token;与扩散竞争/混合 |
| 流匹配 / 一致性模型 |
加速生成 |
少步甚至单步 |
| 编解码音频 (codec LM) |
音乐/语音 |
离散音频 token + 语言模型 |
| 声码器/神经编解码 |
TTS |
声学特征 → 波形 |
2.5 视频比图像难在哪
| 难点 |
简介 |
| 时间维 |
帧间一致、运动合理 |
| 算力 |
分辨率×帧数爆炸 |
| 物理 |
流体、碰撞、手-物 |
| 可控剪辑 |
分镜、镜头语言 |
| 声画同步 |
口型、环境声 |
Index 取向:视频模型开始展现部分 zero-shot 物理/推理 迹象,但「全程连贯真实长视频」仍是公认难关。
技术章:https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
3. 现状全景:三模态对照
3.1 成熟度雷达(2026 中主观标尺)
| 维度(1–5) |
图像 |
视频 |
语音 TTS |
音乐 |
| 默认可用质量 |
5 |
3.5–4 |
5 |
3.5–4 |
| 可控/可编辑 |
4.5 |
3 |
4 |
2.5–3 |
| 开源生态 |
5 |
3 |
3.5 |
2.5 |
| 商用法律清晰 |
3 |
3 |
3 |
2 |
| 实时/低延迟 |
4 |
2–3 |
5(部分 <100ms) |
2–3 |
| 长内容 |
5(单图) |
2(长片) |
4 |
3(整曲可) |
3.2 能力跃迁时间线(粗)
| 年 |
图像 |
视频 |
音频 |
| 2022–23 |
SD 爆火、MJ 美学 |
短、糊、闪 |
早期音乐 demo;TTS 商用化 |
| 2024 |
SD3/FLUX 崛起 |
Sora 示范、Runway/Kling 等军备 |
Suno/Udio 爆款;克隆语音普及 |
| 2025–26 |
2K/4K 标配、多参考、开源逼近闭源 |
原生音画、10s 级精品、企业工具链 |
ElevenLabs 进军音乐;实时 TTS 军备 |
4. 图像生成深挖
4.1 简介
最成熟的生成模态:营销、电商、概念设计、游戏原画流水线已日常使用。
4.2 玩家与定位(快照,会变)
| 产品/模型族 |
类型 |
简介(产业共识取向) |
详细说明 |
| Midjourney |
闭源 |
美学/艺术向强 |
设计师喜爱;社区与风格感 |
| FLUX 族 (Black Forest Labs) |
开源权重 + API |
开源侧画质与听指令标杆 |
pro/flex API;dev 等可自托管;多参考、高分辨率叙事 |
| Stable Diffusion 3.5 |
开源生态 |
工具链最广 |
ComfyUI/LoRA/ControlNet 生态;许可注意营收门槛 |
| OpenAI 图像 (GPT Image 等) |
闭源 |
聊天集成、部分榜领先叙事 |
易用;与 ChatGPT 工作流一体 |
| Google 图像 (Imagen / 产品侧 Nano Banana 等命名) |
闭源 |
高分辨率、生态集成 |
与 Gemini/搜索生态 |
| Ideogram 等 |
闭源 |
文字渲染 |
海报字较好的细分 |
| Recraft 等 |
闭源 |
设计系统/矢量向 |
品牌与 UI 资产 |
行业对比解读例(非论文,作地图):
https://tech-insider.org/best-ai-image-generator-2026/
开源列表例:https://www.bentoml.com/blog/a-guide-to-open-source-image-generation-models
排行榜参考(变化快):Artificial Analysis Image Arena 等
https://artificialanalysis.ai/image/leaderboard/text-to-image
4.3 能力清单(2026)
| 能力 |
状态 |
说明 |
| 原生 2K/4K |
高端标配 |
减少「先糊后超分」 |
| 提示词遵循 |
显著提升 |
FLUX 等以 adherence 著称 |
| 图中文字 |
改善但仍挑模型 |
Ideogram 等细分 |
| 多参考/角色一致 |
可用 |
品牌角色仍要微调或工作流 |
| ControlNet/姿态/深度 |
开源极强 |
生产控制主力 |
| 局部重绘 inpaint |
成熟 |
修图工作流 |
| 批量 API |
成熟 |
电商 SKU |
4.4 工作流组件
| 组件 |
简介 |
| ComfyUI / Forge 等 |
节点式本地流水线 |
| LoRA / DreamBooth |
人/产品/风格 |
| IP-Adapter / 参考 |
保持主体 |
| 放大/修脸/细节 |
后处理 |
| 素材库 + 元数据 |
版本与版权记录 |
4.5 选型简表
| 你的需求 |
更可能优先试 |
| 最美概念艺术 |
Midjourney 类 |
| 听指令 + 可自托管 |
FLUX dev/开源族 |
| 最大插件生态 |
SD 3.5 + ComfyUI |
| 和 GPT 一起改图 |
OpenAI 图像 |
| 海报汉字/字母 |
专测文字模型 |
| 企业 SLA |
云厂商合同产品 |
5. 视频生成深挖
5.1 简介
2025–2026:短视频精品化 + 原生音频 是主跃迁;长片叙事与镜头级剪辑仍靠人+工具。
5.2 玩家与定位(快照)
| 产品 |
简介(产业共识取向) |
详细说明 / 注意 |
| Google Veo (+ Flow 等创作壳) |
电影感、企业安全叙事、原生音画 |
常被当作「精品/企业」首选之一 |
| Kling (快手) |
性价比、运动、口型/角色向功能 |
多评测称「大众最优性价比」 |
| Runway |
创作工作区 + 生成 |
控制与剪辑向;制作团队友好 |
| OpenAI Sora |
物理/运动标杆叙事 |
有产品线收缩/停服时间表的产业报道——部署前必查官网现状 |
| Luma Dream Machine |
运动自然、I2V |
概念到动态 |
| Pika 等 |
轻量、玩法 |
入门与特效 |
| Seedance 等 |
声画联合、口型 |
对话镜头向 |
对比解读例:
https://tech-insider.org/best-ai-video-generator-2026/
https://lushbinary.com/blog/ai-video-generation-sora-veo-kling-seedance-comparison/
重要:Sora 消费端/API 停用时间表以 OpenAI 官方帮助中心为准(产业文多有引用,请核验):
检索 OpenAI Sora discontinuation 或 help.openai.com。
5.3 能力清单(2026)
| 能力 |
状态 |
说明 |
| 5–15 秒精品 |
常用 |
广告、社媒 |
| 原生同步音频 |
多旗舰支持 |
减后期配音步骤 |
| 1080p / 部分 4K |
分层 |
看套餐 |
| I2V 可控 |
常优于纯 T2V |
先定构图 |
| 口型/角色 |
进步快 |
仍有崩 |
| 物理合理性 |
改善 |
手、文字、长程仍翻车 |
| 镜头语言 |
部分提示可用 |
专业摄影需试 |
| 长视频故事 |
弱 |
分段生成+剪辑 |
5.4 Index 技术点(视频)
AI Index Technical 叙述例:Veo 3 在大规模生成测试中展现浮力、迷宫等 未专门训练任务上的行为,被讨论为「视频模型作为 zero-shot 学习者」方向。
来源页:https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
相关研究入口:https://video-zero-shot.github.io
5.5 生产工作流(推荐心智)
剧本/分镜(LLM)
→ 关键帧静图(T2I,定角色与光)
→ I2V / T2V 出镜头
→ 不合格镜重生或 Runway 类工具修
→ 人剪 + 配乐/对白修
→ 合规水印与发布
5.6 选型简表
| 需求 |
优先取向 |
| 电影感精品短片 |
Veo 类 |
| 成本与迭代速度 |
Kling 类 |
| 镜头控制与制作室 |
Runway 类 |
| 从设计图动起来 |
I2V 强的模型 |
| 对话/口型 |
原生音画+口型强的型号 |
6. 音频生成深挖(语音·音乐·音效)
6.1 三大子域
| 子域 |
简介 |
成熟度 |
| TTS / 语音克隆 |
文本→人声;少样本克隆 |
★★★★★ 商用 |
| 音乐生成 |
提示/歌词→歌曲 |
★★★★ 可听;商用法律敏感 |
| 音效 / 语音增强 |
SFX、分离、降噪 |
★★★★ 工具成熟 |
6.2 语音(TTS & 克隆)
玩家快照
| 产品 |
简介 |
详细说明 |
| ElevenLabs |
音质与克隆全能 |
多语言、配音、音效、进军音乐 |
| Cartesia |
超低延迟 |
实时语音 Agent;克隆快 |
| OpenAI TTS |
简单集成 |
预设声线;克隆能力有限/无公开完整克隆(视产品线) |
| Azure / Google Cloud |
企业语音 |
合规审查、定制声 |
| 开源 |
XTTS、Kokoro 等 |
本地隐私 |
对比解读例:
https://sureprompts.com/blog/voice-generation-models-compared-2026
https://gradium.ai/content/best-text-to-speech-apis-2026
能力表
| 能力 |
状态 |
| 自然度 |
短句极高 |
| 情感/表演 |
可控增强,长读物仍要调 |
| 实时 TTFB |
头部可到约 100ms 量级叙事 |
| 克隆 |
数秒~数分钟样本 |
| 多语言 |
头部强;小语种参差 |
| Agent 打断/对话 |
Realtime API 生态 |
风险(语音特有)
| 风险 |
说明 |
| 声纹盗用 |
未授权克隆公众/私人 |
| 诈骗 |
仿领导/亲属 |
| 监管 |
多地深伪/数字副本立法 |
6.3 音乐生成
玩家快照
| 产品 |
简介 |
详细说明 |
| Suno |
完整歌曲+人声标杆叙事 |
歌词曲风强;情感/「怪趣」 |
| Udio |
另一大消费向 |
与 Suno 双雄阶段 |
| ElevenLabs Music |
音质/声线背景切入 |
与语音产品协同;专业向叙事 |
| Google Lyria |
实时器乐等创新 |
研究/产品实验 |
| Stable Audio 等 |
开源/API 音景 |
音效与器乐 |
对比解读例:
https://www.teamday.ai/blog/best-ai-music-models-2026
https://www.aimagicx.com/blog/suno-vs-udio-vs-elevenlabs-music-comparison-2026
ElevenLabs Music 产品:https://elevenlabs.io/music
能力与缺口
| 有 |
缺 |
| 2–4 分钟可听成曲 |
精细编曲编辑器仍弱于 DAW |
| 多曲风、带词 |
商业发行版权灰色/诉讼 |
| 快速 BGM 草稿 |
与真实采样库的权利冲突史 |
详细说明
音乐是 技术可用度 与 版权冲突 最尖锐的模态之一:训练数据是否含受版权保护录音、输出能否商用、平台 ToS 是否indemnify——上线前必须法务过一遍。
6.4 音效与后处理
| 工具类型 |
用途 |
| 文本→SFX |
脚步、环境、UI 音 |
| 音源分离 |
人声/伴奏分轨 |
| 降噪/修复 |
播客、现场 |
| 视频对轨 |
部分视频模型原生;否则后期 |
7. 跨模态工作流与选型指南
7.1 典型流水线
A. 广告短片
| 步 |
工具类型 |
| 1 策略与文案 |
LLM |
| 2 关键视觉 |
T2I / 品牌 LoRA |
| 3 动态 |
I2V / T2V |
| 4 旁白 |
TTS 品牌声 |
| 5 配乐 |
授权库 或 AI 音乐(查权) |
| 6 剪辑合成 |
传统 NLE + 人 |
B. 有声内容
| 步 |
工具 |
| 脚本 |
LLM |
| 朗读 |
TTS/克隆(授权) |
| 音乐床 |
授权 BGM |
| 母带 |
人/工具 |
C. 游戏/互动
| 需求 |
取向 |
| 大量变体贴图 |
本地 SD/FLUX + 管线 |
| 过场预视 |
视频模型 |
| NPC 语音 |
实时 TTS |
7.2 一张选型总表
| 场景 |
图像 |
视频 |
音频 |
| 社媒日更 |
MJ/FLUX |
Kling/Veo 短 |
TTS+库音乐 |
| 品牌主 KV |
可控开源微调 |
慎用纯 AI 成片 |
真人/授权 |
| 内部预演 |
任意 |
任意便宜 |
任意 |
| 实时语音机器人 |
— |
— |
Cartesia/ElevenLabs 类 |
| 发行音乐专辑 |
— |
— |
律师+厂牌 优先于 AI 独作 |
7.3 质量门禁(生产)
| 检查 |
说明 |
| 事实/标识错误 |
假 logo、假文字 |
| 人物权利 |
名人/员工/用户脸与声 |
| 一致性 |
多镜角色、产品 SKU |
| 物理崩坏 |
手、牙齿、物体穿透 |
| 许可 |
训练与输出 ToS、地区法 |
| 披露 |
是否需标 AI 生成 |
8. 版权·深伪·合规与伦理
8.1 简介
生成式媒体的 硬约束 往往不在 GPU,而在法律与平台。
8.2 美国版权取向(摘要)
| 点 |
说明 |
链接 |
| 著作权局 AI 专题 |
分部分报告:数字副本、可版权性等 |
https://www.copyright.gov/ai/ |
| 输出可版权性 |
纯 AI、无足够人类创作贡献时,通常 难获版权(Part 2 等论述) |
同上 Part 2(2025-01 发布叙述) |
| 数字副本/深伪 |
Part 1 强调未授权数字副本威胁,呼吁联邦层面保护 |
报告 PDF 见版权局站点 |
8.3 深伪与立法(摘要)
| 点 |
说明 |
| 亲密图像深伪 |
美国联邦 TAKE IT DOWN Act(2025)等要求平台处理非自愿性内容 |
| 州法 |
选举深伪、性深伪等多州立法扩张(2025–2026 追踪报道) |
| 趋势 |
从罚创作者 → 延伸平台/支付/托管责任;水印与 C2PA 溯源讨论 |
解读入口例:
https://stackcyber.com/posts/ai-deepfake-laws
https://www.multistate.us/insider/2026/2/12/how-ai-generated-content-laws-are-changing-across-the-country
8.4 欧盟等
| 点 |
说明 |
| AI Act 等 |
高风险与透明义务(生成内容标识等,视最终适用) |
| 版权讨论 |
训练阶段与输出阶段权利平衡;纯 AI 输出不宜享版权等议会讨论 |
8.5 伦理实践清单
| 做 |
不做 |
| 对人脸/声线要书面授权 |
未授权克隆真人或员工 |
| 政治广告遵守本地法 |
选举前匿名仿冒候选人 |
| 保留生成日志与提示 |
销毁审计后扯皮 |
| 敏感领域人审 |
全自动发布医疗/新闻画面 |
8.6 溯源技术
| 技术 |
简介 |
| C2PA / Content Credentials |
内容出处元数据 |
| 隐式水印 |
模型侧嵌入 |
| 检测器 |
深伪检测(军备竞赛,不可 100%) |
9. 产业·公司·商业模式
9.1 价值链
| 环 |
玩家类型 |
赚钱方式 |
| 基础模型 |
BFL、Stability、大厂实验室 |
API、订阅 |
| 创作套件 |
MJ、Runway、Adobe Firefly |
订阅 |
| 云分发 |
AWS/GCP/Azure、聚合 API |
算力差价 |
| 垂直应用 |
电商图、配音saas |
按张/分钟 |
| 数据与法务 |
授权图库、保险 |
授权费 |
9.2 商业模式表
| 模式 |
图像 |
视频 |
音频 |
| 订阅 |
常见 |
常见 |
常见 |
| 按次/按秒 |
API |
按秒计费敏感 |
TTS 按字符/分钟 |
| 企业私有化 |
开源+机房 |
较少 |
语音常见 |
| 市场/素材站 |
生成图上架争议 |
少 |
音乐发行争议大 |
9.3 与 Adobe / 设计工具
| 点 |
说明 |
| Firefly 等 |
强调「可商用训练数据」叙事,服务企业采购焦虑 |
| 插件化 |
PS/PR/达芬奇工作流内嵌生成 |
10. 未来情景与时间线
10.1 情景表
| 时期 |
图像 |
视频 |
音频 |
| 2026–27 |
4K/可控标配;本地开源更强 |
原生 AV 普及;10–20s 精品 |
实时语音 Agent 默认;音乐授权产品化尝试 |
| 2027–29 |
设计系统级一致角色 |
分钟级叙事工具;更好物理 |
情感表演 TTS;配乐可编程度↑ |
| 2030 前后 |
与 3D/世界模型打通 |
「可导演讲戏」的交互生成 |
声纹权法律更严;检测常态 |
10.2 技术下一跳
| 候选 |
若成功 |
| 统一音视频生成 |
一次出片 |
| 世界模型驱动镜头 |
物理更稳 |
| 可微编辑 / 层分离 |
像工程文件一样改 AI 片 |
| 强制溯源标准 |
平台互认水印 |
10.3 产业风险
| 风险 |
说明 |
| 版权诉讼集群 |
尤其音乐与图库 |
| 模型停服 |
如部分视频 API 生命周期短 |
| 算力成本 |
视频远贵于图 |
| 信任崩塌 |
深伪导致「眼见不为实」 |
11. 规划与四轮迭代过程
11.1 总规划
| 阶段 |
目标 |
| 规划 |
三模态+底座+合规+产业;双层文档 |
| 迭代 1 |
图像市场与模型格局 |
| 迭代 2 |
视频市场与能力边界 |
| 迭代 3 |
音频(语音+音乐) |
| 迭代 4 |
技术底座、版权深伪、Index、跨模态工作流 |
| 合成 |
本 MD |
11.2 四轮记录
迭代 1 — 图像
迭代 2 — 视频
迭代 3 — 音频
迭代 4 — 底座·法务·总装
11.3 续更模板(第 5 轮)
每月:
[ ] 图像榜/新开源权重
[ ] 视频旗舰版本与价格
[ ] 音乐/TTS ToS 与诉讼
[ ] 本国深伪与标识法规
写入:主张 | 日期 | 链接 | 是否影响生产选型
12. 学习路径
12.1 一周上手
| 天 |
动作 |
| 1 |
读 §0–§3 |
| 2 |
实战 20 张图:同一提示跨 2 个模型 |
| 3 |
实战 5 段视频:T2V vs I2V |
| 4 |
TTS 克隆(仅用自己声音)+ 一段 AI 音乐草稿 |
| 5 |
串一条 15 秒广告流水线 |
| 6 |
读 §8 版权清单,改自己的发布规范 |
| 7 |
写内部选型一页纸 |
12.2 深潜
| 方向 |
材料 |
| 算法 |
DiT 主页 + Weng 视频扩散笔记 |
| 工程 |
ComfyUI 官方文档 + 一个视频 API |
| 法务 |
copyright.gov/ai + 本公司律师 |
| 产业 |
每季重读 AI Index Technical 图像视频节 |
13. 链接总库
13.1 总览与评测
13.2 技术
13.3 图像产业解读
13.4 视频产业解读
13.5 音频
13.6 法律
14. 诚实边界
| 项目 |
说明 |
| 产品名/版本/价格/Elo |
强时效;文中为 2026 中调研快照 |
| 产业博客 |
多用于地图与共识,不等于同行评审 |
| Sora 等存续 |
必须以厂商官网/帮助中心为准 |
| 法律 |
非律师意见;跨境务必本地合规 |
| 未深测 |
未在本文做统一盲测打分;请自建评测集 |
| 中国产品细节 |
有 Kling 等;完整国产矩阵需另开区域迭代 |
附录:一页纸作弊条
图像:最成熟。FLUX/SD 开源可控;MJ 美学;2K/4K 标配。
视频:短片可用;原生声画成趋势;长片靠剪;物理仍崩。
语音:TTS/克隆商用就绪;实时低延迟拼 Agent。
音乐:好听但版权最雷;商用先律师。
技术:潜空间扩散 + DiT 是视听主干。
生产:LLM 脚本 → 静帧定调 → I2V/T2V → 人剪 → 合规。
法律:纯 AI 输出版权弱;深伪立法加强;要授权要日志。
选型:要生态用 SD;要听指令开源试 FLUX;要企业视频看 Veo/Runway;要便宜运动看 Kling。
别做:未授权换脸换声;只信一个榜;无审发关键新闻画面。
更新:每月看版本与 ToS;每季重读 AI Index 图像视频节。
文档结束
路径:D:\AI\量子\AI生成式媒体_图像视频音频_认知手册.md
建议读序:§0 → §3 → 按需 §4/§5/§6 → §7–§8 → 收藏 §13。