琴乐大模型是由腾讯AI Lab与腾讯TME天琴实验室共同研发的人工智能音乐创作大模型。它可以通过输入中英文关键词、描述性语句或音频,能够直接生成立体声音频或多轨乐谱。具体来说,琴乐大模型可以根据文本提示生成44.1kHz的立体声音频(wav)或多轨乐谱(MIDI),包括旋律轨、和弦轨、伴奏轨和打击乐轨等。它还支持对生成的乐谱进行自动编辑,如续写、重新生成指定轨、修改乐器类型等。 琴乐大模型 – 腾讯推出的人工智能音乐创作大模型 琴乐大模型的主要功能特点 音乐生成:通过输入中英文关键词、描述性语句或音频,琴乐大模型可以直接生成44.1kHz的立体声音频(wav)或多轨乐谱(MIDI),包括旋律轨、和弦轨、伴奏轨和打击乐轨。 自动编辑:支持对生成的乐谱进行自动编辑,如续写、重新生成指定轨、重新生成指定小节、修改乐器类型和节奏等。 高质量输出:在大规模双盲听测中,琴乐大模型在多维度主观评分上超越了业内其他音乐生成模型。 多模态支持:模型包含多个模块,包括音频文本对齐模型、乐谱/音频表征提取模型、大语言模型、立体声生成模型和声码器等,能够实现高效、准确的音乐生成。 未来扩展:研究团队计划在模型中加入人声、歌词等要素的生成能力,以更好地服务音乐创作需求。 这个模型的应用非常广泛,可以帮助音乐人更高效地创作音乐,也可以为普通用户提供生成音乐的能力。目前,相关技术已经上线腾讯音乐启明星平台,供音乐创作者使用。 腾讯音乐天琴实验室面向QQ音乐、全民k歌、腾讯音乐人、酷我、酷狗等产品的多媒体与AI应用型技术研究与落地。负责的明星项目包括QQ音乐上的听歌识曲、哼唱识别、翻唱识别、歌词时间戳、臻品音质、DMEE、mv视频剪辑、字幕识别、明星识别;全民K歌上的唱歌评分、智能修音、智能音效、歌声合成;懒人畅听上的AI朗读、AI文稿;直播互动上的智能品鉴、高光识别、端云一体视频质量提升。同时还在探索元宇宙中的虚拟人技术,以虚拟形象、虚拟舞蹈、歌唱表情生成、音乐灯光秀等为核心的小天小琴兄妹虚拟人即将面世,敬请期待。
数据统计
相关导航
Hibiki是一个Kyutai Labs开发的一个用于流式语音翻译(也称为同步翻译)的模型。与离线翻译不同,离线翻译需要等待源语句结束后才开始翻译,而 Hibiki 能够实时积累足够的上下文,以逐块生成正确的翻译。用户在讲话时,Hibiki 会在目标语言中生成自然的语音,并提供文本翻译。
商汤日日新大模型
商汤日日新大模型体系
Adobe Firefly Image2
Adobe Firefly Image 2 是Adobe推出的一款生成式人工智能模型,建立在Firefly图像模型的基础上,专为设计师和创作者提供更强大、更智能的图像生成能力。它通过简单的文字描述,可以生成高质量的图像、文字效果和鲜艳的调色板。
书生通用大模型
书生通用大模型是由上海人工智能实验室发布的大型预训练模型。它包括多个基础模型,如书生·多模态、书生·浦语和书生·天际等。这些模型旨在支持科研创新和产业应用,提供一个全链条开源的研发与应用平台。
阿里云百炼
阿里云百炼是基于通义大模型、行业大模型以及三方大模型的一站式大模型开发平台。面向企业客户和个人开发者,提供完整的模型服务工具和全链路应用开发套件,预置丰富的能力插件,提供API及SDK等便捷的集成方式,高效完成大模型应用构建。
AnimateZero
AnimateZero是腾讯AI团队发布的一款AI视频生成模型,通过改进预训练的视频扩散模型(Video Diffusion Models),能够更精确地控制视频的外观和运动,实现从静态图像到动态视频的无缝转换。
Hyper-SD
Hyper-SD 是字节跳动推出的一种先进图像生成框架,结合了轨迹分段一致性蒸馏(TSCD)和人类反馈学习(RLHF),显著提升了扩散模型在少步骤推理下的图像生成性能。通过 Hyper-SD,用户可以在 1 到 8 步的推理过程中生成高质量的图像,极大地提高了生成速度和效率。
魔搭ModelScope社区
ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!
暂无评论...
