Primeira música grátis no cadastroComeçar grátis

Como gerar qualquer gênero com MiniMax Music 3

Escrito por Quinn Sato · Publicado em 2026-08-17 minimax-music-3structured-captionmusic-caption-rewriterhow-toai-musicgenre-promptslyric-tags
Como gerar qualquer gênero com MiniMax Music 3

Um humor de uma linha — “faz épico”, “piano triste”, “vibe de madrugada” — é uma entrada legal do MiniMax Music 3. Não é a superfície de controle para a qual o modelo foi documentado. O caminho Prompt Enhancement da MiniMax amplia essa linha num Structured Caption: Global Metadata, Vocal Details e um Arrangement seção a seção (blog de pesquisa MiniMax; ficha Hugging Face; GitHub skills).

Esse é o ofício do skill oficial music-caption-rewriter: pegar uma descrição curta mais letra com tags opcional, rotear o brief por 18 famílias de estilo e cerca de 1.000 templates de caption, e devolver um caption pronto para gerar. Depois você coloca o caption no campo de descrição musical e deixa o texto da letra no campo de letra (skills README; ficha do modelo).

Este guia é um how-to, não um ranking. Você sai com a forma de três blocos, um mapa de famílias para “qualquer gênero”, quatro briefs copiáveis e um caminho de teste que começa na mesa de escuta das demos oficiais e termina no workspace do MiniMax Music 3.

TLDR

  • MiniMax Music 3 (pesos abertos em 13 de agosto de 2026) escreve uma música completa a partir de uma descrição musical mais letra opcional, com teto do vendedor de cerca de cinco minutos e WAV estéreo 32 kHz, 16 bits (blog MiniMax; ficha do modelo).
  • Structured Caption são três títulos nesta ordem: Global Metadata, Vocal Details, Arrangement. Os docs oficiais tratam isso como a linguagem de controle preciso, não um rótulo de estilo global (ficha do modelo; GitHub README).
  • music-caption-rewriter é um skill de agente estático (sem APIs extras, sem pesos). Instale com npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter e invoque $music-caption-rewriter (skills README).
  • 18 famílias de estilo cobrem pop e balada, hip-hop e rap, metal e hard rock, orquestral de cinema, Leste Asiático moderno, jazz e swing, e o resto. O router escolhe uma família primeiro e só abre os templates de que precisa (genre router).
  • Neste site: ouça um tema oficial na home e cole o caption reescrito e a letra com tags no workspace. Um run custa 20 créditos; o cadastro dá 20 créditos.

Pontos-chave

  1. Dois campos, dois ofícios. Os docs oficiais de serving colocam a letra em input e a descrição musical em instructions. O skill só reescreve a descrição; não deve citar nem parafrasear versos (GitHub README; SKILL.md).
  2. Tags são estrutura, não enfeite. Coloque [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo] e [Outro] cada um na própria linha (ficha do modelo; tutorial ComfyUI).
  3. Gênero vence adjetivo de humor. O router oficial trata emotional, epic, dark e cinematic como modificadores, a menos que você também dê groove, instrumentos ou um estilo de mercado (genre router).
  4. Não invente BPM ou tom falso. O skill pede um intervalo ou um andamento qualitativo, salvo se um número for explícito ou bem justificado (SKILL.md).
  5. Tags não travam um DAW. Limitações oficiais: andamento, tom, instrumentação, letra e estrutura gerados podem não bater com cada detalhe pedido (ficha do modelo).
  6. Este site é independente. A pesquisa oficial vive no blog MiniMax e no Hugging Face. Ouça demos públicas aqui e gere no workspace do navegador.

O que o skill devolve de verdade

O rewriter é uma biblioteca de texto com divulgação progressiva. Ele não varre os 1.000 templates. Lê o genre router, abre um (às vezes dois) índices de família, pega até três referências com papéis distintos — Foundation, Modifier, Arrangement — e sintetiza um caption novo em torno do seu brief (skills README; SKILL.md).

A saída tem exatamente três títulos de primeiro nível, em inglês salvo pedido contrário, em geral cerca de 250–450 palavras no bloco de arrangement (SKILL.md):

| Bloco | O que nomear | O que não inventar | | --- | --- | --- | | Global Metadata | Gênero / subgênero, andamento (intervalo ou feeling), arco emocional, cena de escuta, perfil de produção | Um BPM ou tom precisos que você nunca deu | | Vocal Details | Gênero do lead, timbre, registro, delivery, harmonia, efeitos contidos | O assunto da letra copiado das estrofes | | Arrangement | Linha do tempo das seções: o que entra, sai ou intensifica | Uma lista estática de equipamento sem arco de energia |

Num pedido instrumental, Vocal Details precisa continuar instrumental e nomear o instrumento que carrega a melodia. O skill é proibido de acrescentar um cantor que você não pediu (SKILL.md).

Diagrama de Structured Caption em três blocos para MiniMax Music 3

Global Metadata · Vocal Details · Arrangement · diagrama editorial · generated for MiniMax Music 3 blog

As 18 famílias de estilo (escolha uma e depois escreva)

Use esta tabela como router, não como playlist. As palavras-chave oficiais vêm do genre router.

| Se o seu brief soa como… | Roteie para | | --- | --- | | Mandopop / C-pop / J-pop com produção eletrônica, R&B ou dance | East Asian modern | | Balada mandopop, guofeng, pop do Leste Asiático acústico ou orquestral | East Asian ballad / heritage | | R&B contemporâneo, neo-soul, trap soul | Modern R&B / neo-soul | | Soul, blues, gospel, worship | Soul / blues / gospel | | Balada vocal de trilha | Cinematic pop / ballad | | Score de filme, trailer, coro, orquestra como identidade | Cinematic orchestral / epic | | Synth-pop, dream pop, retrowave, downtempo | Electronic / synth / ambient pop | | Jazz vocal, swing, bossa, big band | Jazz / swing / big band | | Crooner, teatro musical, doo-wop, cabaré | Traditional vocal / stage | | Hip-hop, rap, trap, drill, lo-fi hip-hop | Hip-hop / rap | | Metalcore, power metal, hard rock | Metal / heavy rock | | Pop rock, indie rock, arena rock, punk | Pop / alternative rock | | Indie folk, cantautor, acústico moderno | Contemporary folk / acoustic | | Céltico, folk tradicional, reggae, instrumentos patrimoniais no centro | Roots / traditional / global | | Só um humor, sem gênero | General pop / ballad (fallback) | | Dance-pop, nu-disco, funk-pop | Dance-pop / disco / funk | | House, trance, techno, drop de festival | Club / EDM / house / trance | | Country, Americana, bluegrass, country pop | Country / Americana |

Regra de fusão do router oficial: “X with Y influences” = X primário, Y secundário. Leia no máximo duas famílias. Uma palavra como cinematic sozinha é modificador, não basta para escolher a família orquestral (genre router).

Se você quer um mapa modelo-contra-modelo em vez de um fluxo de escrita, use o artigo irmão MiniMax Music 3 vs Suno.

Como escrever o brief (cinco passos)

1. Ouça primeiro

Toque um tema oficial na home. Feel Alive é uma referência de R&B com o vocal na frente; In the Way é pop de refrão que volta; The Real Man é uma banda alta. Você está calibrando “como um disco Music 3 pronto pode soar”, não copiando a letra da demo.

2. Nomeie a família numa frase

Escreva o gênero, quem canta (ou “instrumental only”), um instrumento-núcleo e como a energia deve se mover. Exemplo dos próprios docs da MiniMax: “A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.” (GitHub README)

Essa frase já é uma descrição legal. O skill existe quando você quer a expansão de três blocos.

3. Adicione tags de letra só se tiver palavras

Se você tem estrofes, cada tag na própria linha. O skill trata só os colchetes como diretivas musicais. Ele não deve reimprimir o texto da letra dentro do caption (SKILL.md).

Se não tem palavras, pule o modo letra ou use o modo instrumental no workspace.

4. Expanda — ou cole a linha curta

Opção A — você já usa Cursor / Claude Code / Codex:

npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter

Depois peça: Use $music-caption-rewriter to turn my music description and optional tagged lyrics into a concise, section-aware Music 3.0 caption. (skills README)

Opção B — você só quer uma música hoje: cole os Prompts A–D abaixo na caixa de descrição do workspace. Uma frase curta no estilo oficial ainda gera; a forma de três blocos serve para um controle mais apertado (ficha do modelo).

5. Gere neste site

Abra o workspace do MiniMax Music 3. Coloque o caption no campo prompt / descrição. Coloque a letra com tags no modo letra. Mude para o modo instrumental no Prompt D. Um run custa 20 créditos.

Briefs copiáveis (quatro ofícios)

São briefs de workspace originais, não arquivos de template copiados. Mude só nomes que você possui. Pontue cada take em estrutura, sustentação da letra, encaixe vocal, clareza de arranjo e um final usável.

Prompt A — pop acústico que precisa abrir

### Global Metadata
Genre: contemporary acoustic pop. Mid-tempo, unhurried pulse.
Intimate verse that opens into a wider, brighter final chorus.
Late-evening room, close-mic singer-songwriter production.

### Vocal Details
Soft female lead, close and breathy in the verse, clearer and more
supported in the chorus, light stacked harmonies only on the last chorus.
No rap, no choir wall.

### Arrangement
[Intro] fingerpicked guitar and a soft piano figure, no drums.
[Verse] guitar stays primary; piano answers between lines.
[Pre-Chorus] brushed kit and upright bass enter quietly.
[Chorus] drums and bass lock; guitar opens; piano widens.
[Verse] drop back toward the intro texture.
[Chorus] fuller than the first chorus.
[Outro] guitar and piano only, soft landing, no hard cutoff.

[Verse]
Morning light filtering through the pine
Every quiet street is yours and mine
[Chorus]
Softly the world begins to breathe
[Verse]
I keep the window cracked for the rain
[Chorus]
Softly the world begins to breathe
[Outro]
Leave the light on for the evening

As duas primeiras linhas de letra seguem o dístico de exemplo público da MiniMax; o resto é uma folha curta original para o refrão poder voltar (GitHub README).

Prompt B — R&B trap-soul, cantor na frente

### Global Metadata
Genre: contemporary R&B / trap soul. Slow-to-mid pocket, late-night.
Verse stays close and conversational; chorus opens without turning into EDM.
Headphones, dry-room vocal, polished but not glossy.

### Vocal Details
Mature male lead, warm baritone-tenor, intimate verse, fuller chorus.
Soft stacked backgrounds on the chorus only. No guest rap unless tagged.

### Arrangement
[Intro] electric piano and a muted guitar lick, 808 far back.
[Verse] hats stay quiet; bass is felt more than heard.
[Pre-Chorus] hats open a little; a second vocal layer appears.
[Chorus] 808 and clap land; keys widen; guitar stays decorative.
[Bridge] strip to keys and voice.
[Chorus] last chorus keeps the low end but does not add a festival drop.
[Outro] keys and a fading 808, no riser.

[Verse]
City lights smear on the window glass
I replay the message I should not have
[Pre-Chorus]
Tell me if the night is still honest
[Chorus]
Keep the low end under my voice
Do not let the drums start a fight
[Bridge]
If the hook comes back, let it come quiet
[Chorus]
Keep the low end under my voice
[Outro]
Leave the last note in the room

Prompt C — Mandopop / Leste Asiático moderno, voz primeiro

### Global Metadata
Genre: modern Mandopop with restrained electronic R&B color.
Mid-slow ballad pulse. Tender verse, lifted but not shouted chorus.
Indoor night scene, warm vocal in front of room piano and light pads.

### Vocal Details
Clear female lead, speech-like verse, longer tones in the chorus.
Light doubles on the chorus. No English rap, no stadium gang vocals.

### Arrangement
[Intro] room piano and a distant guzheng figure.
[Verse] piano and a soft electronic pulse; guzheng answers phrases.
[Pre-Chorus] pads rise; kick stays soft.
[Chorus] full but still singer-first; strings enter under the last line.
[Verse] thinner than verse one.
[Chorus] slightly wider than the first chorus.
[Outro] piano and guzheng only.

[Verse]
屋檐下青苔长
木窗边月影扬
[Chorus]
岁月如歌 歌声悠长
我们牵手走过风霜
[Verse]
摇椅轻晃夕阳下
[Chorus]
岁月如歌 歌声悠长
[Outro]
人间烟火 平淡无瑕

As amostras oficiais da MiniMax incluem uma balada mandarim quente e um corte jazz / soul de Xangai; este brief é um ponto de partida do workspace, não a afirmação de que cada run vai bater com essas demos (blog MiniMax; demo oficial).

Prompt D — instrumental de cinema, sem cantor

### Global Metadata
Genre: cinematic orchestral cue, not a pop song.
Slow build from a thin solo line to a controlled mid-fortissimo, then release.
Trailer-adjacent, but no cheap brass stab every four bars.

### Vocal Details
Instrumental only. No lead singer, no choir lyric, no whispered vocal hook.
Low strings and a solo cello carry the melody.

### Arrangement
[Intro] solo cello, almost dry.
[Instrumental] violas and a quiet pulse enter; harp is decorative.
[Instrumental] low brass supports, percussion stays military-soft.
[Instrumental] peak without a jump-scare hit.
[Outro] cello alone, room tail, no hard cutoff.
[Instrumental]
[Outro]

Os docs oficiais documentam um caminho instrumental no conjunto caption / tags (tutorial ComfyUI). Use o modo instrumental no workspace para o modelo não ser pedido a inventar um cantor.

Controles, falhas, checklist

Controles que de fato existem neste site

  • Modos prompt / letra / instrumental no workspace
  • Um custo de 20 créditos mostrado antes do run
  • Replay da biblioteca mais download WAV / MP3 depois de uma take pronta

Falhas que os docs oficiais já avisam

  • Tags e captions são controle generativo, não um mapa de andamento travado nem uma lista de instrumentos garantida (ficha do modelo)
  • Self-host local é outro ofício (documentado em torno de 24 GB em precisão cheia, cerca de 8 GB com streaming de camadas). Este site é o caminho do navegador (ficha do modelo)
  • A duração do vendedor vai até cinco minutos; as demos oficiais da home ficam perto de três minutos. Não leia cada run hospedado como um render de cinco minutos (ficha do modelo; ComfyUI)

Checklist antes de gastar os próximos 20 créditos

  1. Um nome de família, não cinco adjetivos empilhados
  2. Gênero de quem canta ou “instrumental only”
  3. Um instrumento que precisa continuar audível
  4. Tags na própria linha se você tem letra
  5. Você já ouviu uma demo da home que combina com o ofício

O que sabemos vs. o que não afirmamos

| Sabemos (com fonte) | Não sabemos / não afirmamos | | --- | --- | | Lançamento open-weight do Music 3 em 2026-08-13 (blog MiniMax; X) | Que um caption de três blocos sempre vence um vibe de uma frase em todo gênero | | Skill oficial: 18 famílias, ~1.000 templates, biblioteca de texto estática (skills README) | Que o rewriter copia um ID de template para a sua música (ele é instruído a não fazer isso) | | Caption → instructions, letra → input (GitHub README) | Que os runs hospedados aqui expõem esses nomes crus de campo de API na UI | | Tags de seção + caption são controle documentado, não garantias simbólicas (ficha do modelo) | Travamento exato de BPM / tom / instrumento em cada take | | Este produto: 20 créditos por run, 20 créditos no cadastro | Tabelas de compra dólar-por-música entre canais |

FAQ

Preciso do skill music-caption-rewriter para usar o MiniMax Music 3?

Não. Os docs oficiais dizem que uma descrição concisa em linguagem natural pode ser usada direto. O skill serve para um controle mais rico e mais preciso (ficha do modelo; skills README).

Como gerar gêneros diferentes com o MiniMax Music 3?

Nomeie uma família do router (pop, hip-hop, jazz, orquestral de cinema, Leste Asiático moderno e o resto) e escreva Global Metadata + Vocal Details + Arrangement. Cole isso no workspace. Palavras de humor sozinhas caem no fallback general pop / ballad (genre router).

O que vai na letra vs na descrição musical?

Letra: palavras mais tags de seção. Descrição: estilo, emoção, vocal, instrumentos e como o arranjo muda. Não cole o mesmo verso nos dois campos (GitHub README; SKILL.md).

O MiniMax Music 3 faz instrumental?

Sim. Diga instrumental no caption e use o modo instrumental. Os materiais oficiais incluem [Instrumental] como tag (ComfyUI). O Prompt D é o ponto de partida copiável.

O modelo vai acertar meu BPM e tom exatos?

Não como garantia. As limitações oficiais dizem que andamento, tom, instrumentação, letra e estrutura podem derivar (ficha do modelo). Prefira um feeling de andamento, salvo se você realmente precisa de um número.

Este site é oficial da MiniMax?

Não. minimaxmusic3.org é um produto independente. A pesquisa oficial está no blog MiniMax e no Hugging Face. Hospedamos o áudio público de demo para você ouvir uma referência antes de gastar créditos.

Como funcionam os créditos aqui?

Um run musical custa 20 créditos. O cadastro dá 20 créditos, então a primeira música está coberta. As seguintes usam um pacote único. Runs que falham devolvem créditos. Este artigo não compara listas de preço de outras empresas.

Posso usar uma música gerada comercialmente?

Os pacotes pagos de créditos neste site incluem uso comercial conforme as páginas legais. A música de teste do cadastro é para teste pessoal. A Community License da MiniMax é um contrato separado se você self-hostar os pesos (LICENSE).

Por onde começar se eu só tenho um humor?

Toque uma demo da home e rode o Prompt A (pop vocal) ou o Prompt D (instrumental). Acrescente quem canta e um instrumento antes de empilhar adjetivos.

O skill reescreve a minha letra?

Não. Regras oficiais do skill: o texto da letra nunca é reproduzido nem reescrito; só as tags entre colchetes agem como diretivas musicais (skills README).

Devo comparar preços entre plataformas aqui?

Não. Decida por encaixe do ofício e taxa de keeper, depois precifique na superfície de onde você realmente entrega.

Sobre Quinn Sato

Quinn Sato escreve fluxos musicais: letra, captions e briefs instrumentais viram workflows de navegador repetíveis no MiniMax Music 3.

More Posts