腾讯云媒体处理 MPS 扩展 AI 生成与智能媒体处理能力,新增漫剧、视频裂变、音色克隆与智能字幕

能力扩展概述

根据腾讯云媒体处理官方接口清单的更新,MPS 在原有转码、截图、水印、内容理解与审核等能力之上,新增了一组围绕 AI 生成与智能媒体处理的接口,覆盖内容生成、交互式辅助、智能录制、音色处理与字幕处理五个方向。对已经使用 MPS 做批量媒体处理的团队而言,这些能力意味着同一套编排流程里可以直接调用生成式处理节点,而不必再接入多套独立服务。

AI 内容生成

新增的 AIGC 系列接口支持创建生视频、生图片与生音频任务,并提供自定义主体与自定义素材管理,用于保持生成内容中人物或物体的一致性;涉及人物形象的场景还提供了人脸验证接口与用于调用生成接口的令牌管理。在此基础上,官方还新增了两类面向业务场景的封装能力:

  • AI 漫剧任务:面向连续剧情类内容的生成,适合把图文脚本批量转化为分镜与成片。
  • AI 视频裂变任务:面向同一素材的批量变体生成,适合投放与运营场景中快速产出多个版本。

生成结果可写入指定的对象存储路径,便于与后续转码、审核、发布环节串联。

MPS-Copilot 与 Agent 录制

MPS 新增了对话式辅助接口。开发者可以通过对话方式发起或编排处理任务,把以往需要查阅接口文档再拼装参数的过程,转化为更自然的交互方式,降低新同学的接入门槛。与此配套,官方还新增了 Agent 录制任务接口,用于把智能体的操作过程录制为视频产物,适合演示、培训与过程留档等场景。

音色与语音处理能力

语音方向新增了音色克隆与同步音色转换接口,支持把指定音色复用于新的配音内容,适合多语种版本、批量解说与虚拟形象配音。同时新增的「爆款复刻」能力面向已有高热内容的二次创作,便于在保持结构的前提下快速产出新素材。配合已有的音频处理能力,MPS 可以覆盖从配音生成到音画合成的主要环节。

智能字幕升级

字幕方面,MPS 接入了新一代语音识别引擎的预览版本,提供两种接入方式:一是通过媒体处理任务异步提取字幕,可在控制台直接发起,适合处理已有的视频或音频文件;二是通过同步音频识别接口直接传入音频数据并返回识别文本,适合对实时性要求更高的场景。官方资料显示,该引擎针对复杂语音场景做了增强,覆盖多种方言、专业领域词汇、中英文混读、高噪声环境与低音量耳语等难点,并提供智能纠错能力。此外,新增的术语对接口允许批量维护专有词汇,用于提升垂直领域字幕中人名、地名与产品名的识别准确率。

批量与运营能力

除生成类能力外,本次接口更新还补充了批量处理能力,支持批量发起媒体处理任务、批量启停媒体传输流与批量删除传输流,并对服务端广告插入、媒体封装用户开通等运营相关能力提供了独立接口。这些补充主要面向大规模媒资处理与直播分发场景,便于通过单次请求管理成批任务,降低调用复杂度。

接入建议

建议先在测试环境中验证生成类任务的产出质量与耗时,确认生成结果的对象存储路径、命名规则与后续流程兼容;使用音色克隆与涉及人物形象的能力时,应确保已取得相应授权并遵循平台的内容合规要求;字幕场景建议先导入业务专有术语表,再对比新旧引擎在真实素材上的识别准确率。由于部分能力仍处于预览或快速迭代阶段,正式上线前应确认相关接口的计费方式与可用区域。

评论