“快下班发现又下雨了,崩溃了,歌曲丧一点但也要轻松一点,我明天上班路上听。”
大多数人并非没有音乐想法。相反,我们一般很清楚自己想要什么感觉,但不知道如何把这种感觉,翻译成节拍、调式、、乐器和编曲。
过去用 AI 音乐工具,用户往往得先填曲风、嗓音、乐器、BPM 这些标签后,模型才能生成一首完整的歌。但模型不一定可以很好理解多个 tag 之间的关系。多生成几次、反复「抽卡」,成了不少人的日常。
阿里巴巴这次打造的 HappyShrimp 1.0 ,想解决的,正是这层表达损耗。
HappyShrimp,快乐虾米。这一个名字很容易让人想起曾经的虾米音乐。直到今天,许多用户仍把它视为中文互联网最纯粹、最专业的音乐平台之一。精准而有性格的推荐、对独立音乐人的关注,以及用户共同维护音乐的社区氛围,都很难被后来的平全复制。
现在,HappyShrimp,快乐虾米,则致力于让更多普通人在 AI 时代,也能继续做音乐创作的「快乐小虾米」。过去的虾米帮助普通人发现音乐,今天的快乐虾米则希望帮助普通人创作音乐。
HappyShrimp 1.0 是一款面向普通用户和内容创作者的 AI 音乐模型产品,目前主打文本生成音乐功能。
在这个万物皆可一句话生成的时代,HappyShrimp 的「一句话生成」只是操作方式,不是产品最终要证明的能力。
用户不必先学 Prompt 模板,也不用掌握 BPM、调式、和声、配器这些专业乐理知识,直接用日常语言描述人物、故事、情绪和场景就行,HappyShrimp 负责把这些天马行空的想法变成一首好听的歌。
对音乐产品来说,好听是第一原则。降低门槛,只有在生成结果足够好听、足够完整时才有意义。
这里的好听可以拆解为:旋律是否完整、结构是不是清晰、表达是否贴合指令、编曲是否克制。
硅星人第一时间拿到了 HappyShrimp 的内测资格,让我们来看看对非音乐专业出身的普通人来说,HappyShrimp 到底有没那么简单易上手。
叠甲,作者网易云音乐和 QQ 音乐均 7 级,属于爱听歌那挂的中级听众。
测试说明: 为便于横向比较,以下每个测试都从三个维度给出简评:指令遵循度(是否听懂要求)、音乐性(旋律、结构、编曲是否成立)、音质与质感(人声、混音是否接近真人)。
测试按照理解难度逐级推进:先看它能否读懂一个角色,再让它为七夕创作一首特殊的“恋之歌”,随后考察它对日常情绪和圈层审美的理解。最后,我们会输入一条包含多重要求的长 Prompt,检验其指令遵循和音乐控制的上限,并用同一任务与 Suno 进行正面对比。
以《欢迎来龙餐馆》主角徐福为对象,为他创作一首人物主题曲。我先准备好了歌词,使用了「自定义歌词」功能。
创作一首中文电影叙事民谣,整体气质温暖,男中低音演唱,声线略带沙哑和疲惫感,咬字自然,有生活。主歌采用近乎低声诉说的唱法,进入“炮声掀翻门前的招牌”后,加入低沉鼓点与弦乐,情绪逐渐收紧;副歌“欢迎来龙餐馆”旋律要简单、有记忆点,情绪从恐惧转向坚定,突出“我也怕,体现普通人勇气。
编曲以木吉他、钢琴和低音弦乐为主。前奏安静,最后一遍副歌加入克制的人声和声,让音乐变得开阔,但别过度煽情。结尾逐渐收掉鼓乐,只留下木吉他、环境风声。
主歌的低声诉说感、副歌的旋律记忆点、结尾的收束方式,都符合 Prompt 的设定。最后一遍副歌的人声和声被处理得更接近低声念白,和原本设想略有不同,但不影响整首歌的叙事推进。正式使用时,也能够准确的通过需要剪掉这一小段。
指令遵循度:较高;音乐性:良好;音质与质感:优秀。整体属于可用的「人物主题曲」生成器,尤其推荐《欢迎来龙餐馆》的影迷来评鉴一下,看这首歌有没有唱出你心里的徐福。
马上七夕了,我想写一个恋爱的小情歌,男女合唱,俏皮舒缓,我和我对象是在北京认识的,我们很合拍,他非常浪漫,会给我写手写信,每个节日都会准备礼物,我们大家常常一起打羽毛球,除了恋爱,我们也是彼此的好朋友,你可以把这一些要素放进歌词里。
这首同样只用了 20 积分,生成速度快。最让我惊喜的是歌词部分,它没有把北京、手写信、节日礼物和羽毛球像清单一样逐项念出来,而是将细节融进了具体场景,留出想象空间,听起来不像一篇被强行谱曲的恋爱小作文。
男女声的配合带着一点轻松的对话感,旋律俏皮但不喧闹,很适合恋爱 Vlog 或者纪念视频。
指令遵循度:较高;音乐性:良好;音质与质感:中等。综合看来,适合为恋爱视频配一首只属于两个人的 BGM,或者把共同经历做成礼物。比起套用一首所有人都在用的热门情歌,至少这里唱的是你们自己的故事。
写一首有韩团舞台感的中文歌,副歌要有记忆点,但不要太燥。主歌保留一点 R&B 的松弛感,女声,情绪自信但不要口号。
韩团舞台感、R&B 主歌、女声、自信情绪和副歌记忆点,它基本都抓到了。歌词尾部有押韵,但整体音效仍显得偏满。
乐器和音效给得太满,整体有喧嚣感。「韩团舞台感」被它理解成了更多鼓点、更多合成器和更厚的声部,不过旋律和演唱依然拔高了整体表现。
指令遵循度:良好;音乐性:良好;音质与质感:中等。综合看来,可以在创作时对“不要太燥”这类负面指令做二次强调,或者手动减少配器。生成结果作为 Demo 完全够用。
为了测试控制力,我把曲风、年代、人声、速度、调式、配器、结构和情绪放进同一条 Prompt:
写一首讲凌晨独自坐末班公交回家的千禧年华语流行摇滚。男声,86 BPM,E小调;主歌像靠着车窗低声自言自语,副歌随着城市灯光铺开。配器以木吉他、旧钢琴和干净的电吉他为主,加入轻微的磁带噪声;第一遍副歌保持简单,第二遍副歌加入更厚的贝斯与鼓组,结尾重新收回到钢琴独奏。整体保留2000年前后华语唱片的温暖质感。
整体风格很摇滚,乐器也基本根据相关要求的顺序进入,没有从 Prompt 里抓几个关键词,再把所有元素一起堆进歌曲。磁带噪声有了,年代感也有了,但距离那个时期真实唱片中的录音空间和人声质感,还有一定距离。
多维指令同时叠加时,HappyShrimp 没有把指令简单相加,而是让不同指令在不同段落各司其职。
指令遵循度:较高;音乐性:良好;音质与质感:中等。综合看来,生成结果能作为一个「合格的 Demo」,但若用于正式发行,还需要人工后期处理。
为了进一步验证 HappyShrimp 的理解能力,我们用同一主题与 Suno 做了一次对比。
风格:以充满推进感的节奏为基础,保留 boom bap rap 厚重、松弛的鼓点律动。使用低沉、克制且略带疏离感的人声,编曲融合 dark wave 的阴郁电子氛围与原声吉他的真实质感,并在副歌中加入 garage pop 粗粝、明亮、抓耳的能量。几种风格应当自然交融,保持一定的实验性,避免听起来像简单的元素拼贴。歌词方向:围绕爱、实验和“My favorite genre”展开
Suno 在 Tag 输入下,生成结果基本覆盖了所有指定元素,但听起来比较平淡。
相比之下,HappyShrimp 的质量明显更好。几种跨度很大的音乐元素没有互相打架,而是按照段落自然推进:主歌偏暗、副歌偏亮,原声吉他与电子氛围交替出现,整体听起来像一首经过精心编排的歌。
这轮对比的核心差异,来自对自然语言关系的理解。Tag 告诉模型要哪一些元素,但面对复杂创作意图,非 Tag 式输入更容易把人的想法说完整。完整的自然语言能说明这些元素分别承担啥作业、应该在哪个段落出现,以及彼此之间怎样衔接。当模型拿到的不只是一份素材清单,而是一份简化的编曲说明,也就更能生成出预期中的作品。
指令遵循度:高;音乐性:优秀;音质与质感:优秀。从这轮看,HappyShrimp 在自然语言理解和复杂风格融合上,确实比 Tag 式工具更接近「听懂人线. 其他功能:纯音乐、灵感骰子与创作管理
此外,你可以在【创作】页面实时看见自己的创作过程和记录。【资产】页面则以日期对创作进行记录。
系统先做统一的音乐语义理解和整体规划,再完成整首歌的生成与高保真重建。歌词、旋律、编曲、人声在生成过程中相互约束、一体成型,控制条件贯穿始终。这既保住了歌曲的长程结构与音乐性,也兼顾音质和对用户意图的遵循。
AI 音乐这两年很热闹,海外,Suno、Udio 已能让普通用户用一句 Prompt 生成完整歌曲。国内,网易天音、腾讯音乐启明星、字节跳动海绵音乐等产品相继入场,分别从音乐人工具、平台生态和短视频场景切入。但生成能力一旦普及,竞争焦点就转向拼理解力,到底能不能听懂人话,能不能把「我想要的」和「我得到的」之间的
其实对普通人来说,它只是多了一种表达的方式。你可以用文字表达,用视频表达,也可以用音乐表达。过去这道门槛太高,很多人心里有旋律却开不了口;现在,一句话就能让想法变成声音。