首页
AI / 大模型
  • 智能体 Agent
  • 大模型工程
  • 模型原理
  • AI 应用
  • 检索增强 RAG
大数据
  • Flink
  • Kafka
  • ClickHouse
  • Hive
  • ZooKeeper
  • Hadoop
运维部署
  • 网站部署
  • 后端与工程
项目管理 关于本站
峰的个人知识库 菜单
  1. 首页
  2. AI / 大模型
    1. 智能体 Agent
    2. 大模型工程
    3. 模型原理
    4. AI 应用
    5. 检索增强 RAG
  3. 大数据
    1. Flink
    2. Kafka
    3. ClickHouse
    4. Hive
    5. ZooKeeper
    6. Hadoop
  4. 运维部署
    1. 网站部署
    2. 后端与工程
  5. 项目管理
  6. 关于本站
快捷操作
登录

文生视频与语音生成
模型原理 2025.11.24
阅读 0 评论 0 点赞 0

文生视频与语音生成

本文介绍了文生视频和语音生成两大方向。文生视频在图像扩散基础上增加时间维度,采用DiT架构和时空patch(如Sora),核心难点是时序一致性。主流产品包括Sora、可灵、Runway Gen-3和Pika。语音生成TTS经典链路为文本→声学特征→声码器→波形,代表方法有VITS和扩散类TTS,而zero-shot语音克隆(如ElevenLabs、CosyVoice)可用几秒音频合成新语音。ASR(Whisper)与TTS互为逆过程,数字人通过TTS加口型驱动实现。此外,视频生成因时序一致性和算力需求比图像更难;TTS效果用MOS评价;流式TTS需分块生成并低延迟播放;语音克隆存在声音伪造等滥用风险,需授权和风控机制。

#文生视频#语音生成#TTS
DATA · LLM · DEVOPS DATA · LLM · DEVOPS DATA · LLM · DEVOPS DATA · LLM · DEVOPS
F Archive

沉淀后端底层、大数据工程与大模型落地实践,结构化归档技术学习笔记。

导航

  • 首页
  • AI / 大模型
  • 大数据
  • 运维部署
  • 项目管理
  • 关于本站

© 2026 峰的个人知识库. 保留所有权利.

用 ♥ 与氢气构建

Built with Theme 氢·简 CMS Halo