Premier morceau gratuit à l’inscriptionCommencer gratuitement

Comment générer n'importe quel genre avec MiniMax Music 3

Écrit par Quinn Sato · Publié le 2026-08-17 minimax-music-3structured-captionmusic-caption-rewriterhow-toai-musicgenre-promptslyric-tags
Comment générer n'importe quel genre avec MiniMax Music 3

Une humeur d’une ligne — « fais-le épique », « piano triste », « vibe de fin de soirée » — est une entrée MiniMax Music 3 légale. Ce n’est pas la surface de contrôle pour laquelle le modèle a été documenté. Le chemin Prompt Enhancement de MiniMax élargit cette ligne en Structured Caption : Global Metadata, Vocal Details, et un Arrangement section par section (blog recherche MiniMax ; fiche Hugging Face ; GitHub skills).

C’est le métier du skill officiel music-caption-rewriter : prendre une description courte plus des paroles balisées optionnelles, router le brief à travers 18 familles de style et environ 1 000 modèles de caption, et renvoyer une caption prête à générer. Vous placez ensuite la caption dans le champ description musicale et vous gardez le texte des paroles dans le champ paroles (skills README ; fiche modèle).

Ce guide est un mode d’emploi, pas un classement. Vous repartez avec la forme à trois blocs, une carte de familles pour « n’importe quel genre », quatre briefs à copier-coller, et un chemin d’essai qui commence au bureau d’écoute des démos officielles et se termine dans l’espace MiniMax Music 3.

TLDR

  • MiniMax Music 3 (poids ouverts le 13 août 2026) écrit une chanson complète à partir d’une description musicale plus des paroles optionnelles, avec un plafond vendeur d’environ cinq minutes et un WAV stéréo 32 kHz, 16 bits (blog MiniMax ; fiche modèle).
  • Structured Caption : trois titres dans cet ordre — Global Metadata, Vocal Details, Arrangement. Les docs officielles en font le langage de contrôle précis, pas une étiquette de style globale (fiche modèle ; GitHub README).
  • music-caption-rewriter est un skill agent statique (pas d’API extra, pas de poids). Installation : npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter, puis invoquez $music-caption-rewriter (skills README).
  • 18 familles de style couvrent pop & ballade, hip-hop & rap, metal & hard rock, orchestral ciné, Asie de l’Est moderne, jazz & swing, et le reste. Le routeur choisit d’abord une famille, puis n’ouvre que les modèles dont il a besoin (genre router).
  • Sur ce site : écoutez un titre officiel sur l’accueil, puis collez la caption réécrite et les paroles balisées dans l’espace. Un run = 20 crédits ; l’inscription offre 20 crédits.

Points clés

  1. Deux champs, deux métiers. Les docs officielles de serving mettent les paroles dans input et la description musicale dans instructions. Le skill ne réécrit que la description ; il ne doit ni citer ni paraphraser les lignes de paroles (GitHub README ; SKILL.md).
  2. Les balises sont de la structure, pas du décor. Placez [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo] et [Outro] chacun sur sa propre ligne (fiche modèle ; tutoriel ComfyUI).
  3. Le genre bat les adjectifs d’humeur. Le routeur officiel traite emotional, epic, dark et cinematic comme des modificateurs, sauf si vous donnez aussi un groove, des instruments ou un style de marché (genre router).
  4. N’inventez pas un faux BPM ou une fausse tonalité. Le skill demande une plage ou un tempo qualitatif, sauf si un chiffre est explicite ou fortement justifié (SKILL.md).
  5. Les balises ne verrouillent pas un DAW. Limites officielles : tempo, tonalité, instrumentation, paroles et structure générés peuvent ne pas coller à chaque détail demandé (fiche modèle).
  6. Ce site est indépendant. La recherche officielle vit sur le blog MiniMax et Hugging Face. Écoutez les démos publiques ici, puis générez dans l’espace navigateur.

Ce que le skill renvoie vraiment

Le rewriter est une bibliothèque de texte à divulgation progressive. Il ne scanne pas les 1 000 modèles. Il lit le genre router, ouvre un (parfois deux) index de famille, prend jusqu’à trois références aux rôles distincts — Foundation, Modifier, Arrangement — et synthétise une nouvelle caption autour de votre brief (skills README ; SKILL.md).

La sortie fait exactement trois titres de premier niveau, en anglais sauf demande contraire, typiquement environ 250–450 mots pour le bloc arrangement (SKILL.md) :

| Bloc | Quoi nommer | Quoi ne pas inventer | | --- | --- | --- | | Global Metadata | Genre / sous-genre, tempo (plage ou feeling), arc émotionnel, scène d’écoute, profil de prod | Un BPM ou une tonalité précis que vous n’avez jamais donnés | | Vocal Details | Genre du lead, timbre, registre, delivery, harmonies, effets retenus | Le sujet des paroles recopié depuis les couplets | | Arrangement | Timeline des sections : ce qui entre, sort ou s’intensifie | Une liste de matos statique sans arc d’énergie |

Pour une demande instrumentale, Vocal Details doit rester instrumental et nommer l’instrument qui porte la mélodie. Le skill a interdiction d’ajouter un chanteur que vous n’avez pas demandé (SKILL.md).

Schéma Structured Caption à trois blocs pour MiniMax Music 3

Global Metadata · Vocal Details · Arrangement · schéma éditorial · generated for MiniMax Music 3 blog

Les 18 familles de style (choisissez-en une, puis écrivez)

Servez-vous de ce tableau comme routeur, pas comme playlist. Les mots-clés officiels viennent du genre router.

| Si votre brief sonne comme… | Router vers | | --- | --- | | Mandopop / C-pop / J-pop avec prod électronique, R&B ou dance | East Asian modern | | Ballade mandopop, guofeng, pop d’Asie de l’Est acoustique ou orchestrale | East Asian ballad / heritage | | R&B contemporain, neo-soul, trap soul | Modern R&B / neo-soul | | Soul, blues, gospel, worship | Soul / blues / gospel | | Ballade vocale façon bande-son | Cinematic pop / ballad | | Score de film, trailer, chœur, orchestre comme identité | Cinematic orchestral / epic | | Synth-pop, dream pop, retrowave, downtempo | Electronic / synth / ambient pop | | Jazz vocal, swing, bossa, big band | Jazz / swing / big band | | Crooner, comédie musicale, doo-wop, cabaret | Traditional vocal / stage | | Hip-hop, rap, trap, drill, lo-fi hip-hop | Hip-hop / rap | | Metalcore, power metal, hard rock | Metal / heavy rock | | Pop rock, indie rock, arena rock, punk | Pop / alternative rock | | Indie folk, auteur-compositeur, acoustique moderne | Contemporary folk / acoustic | | Celtique, folk traditionnel, reggae, instruments patrimoniaux au centre | Roots / traditional / global | | Seulement une humeur, pas de genre | General pop / ballad (repli) | | Dance-pop, nu-disco, funk-pop | Dance-pop / disco / funk | | House, trance, techno, drop festival | Club / EDM / house / trance | | Country, Americana, bluegrass, country pop | Country / Americana |

Règle de fusion du routeur officiel : « X with Y influences » = X primaire, Y secondaire. Lisez au plus deux familles. Un mot comme cinematic seul est un modificateur, pas assez pour choisir la famille orchestrale (genre router).

Si vous voulez une carte modèle-contre-modèle plutôt qu’un flux d’écriture, lisez l’article jumeau MiniMax Music 3 vs Suno.

Comment écrire le brief (cinq étapes)

1. Écoutez d’abord

Jouez un titre officiel sur l’accueil. Feel Alive est une référence R&B portée par la voix ; In the Way est une pop à refrain qui revient ; The Real Man est un groupe fort. Vous calibrez « à quoi peut ressembler un disque Music 3 fini », vous ne copiez pas les paroles de démo.

2. Nommez la famille en une phrase

Écrivez le genre, qui chante (ou « instrumental only »), un instrument-clé, et comment l’énergie doit bouger. Exemple des docs MiniMax : “A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.” (GitHub README)

Cette phrase est déjà une description légale. Le skill existe quand vous voulez l’expansion à trois blocs.

3. Ajoutez des balises de paroles seulement si vous avez des mots

Si vous avez des couplets, chaque balise sur sa ligne. Le skill ne traite que les crochets comme directives musicales. Il ne doit pas réimprimer votre texte de paroles dans la caption (SKILL.md).

Si vous n’avez pas de mots, sautez le mode paroles ou passez en mode instrumental dans l’espace.

4. Développez — ou collez la ligne courte

Option A — vous utilisez déjà Cursor / Claude Code / Codex :

npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter

Puis demandez : Use $music-caption-rewriter to turn my music description and optional tagged lyrics into a concise, section-aware Music 3.0 caption. (skills README)

Option B — vous voulez juste un morceau aujourd’hui : collez les Prompts A–D ci-dessous dans la boîte description de l’espace. Une phrase courte de style officiel génère encore ; la forme à trois blocs sert un contrôle plus serré (fiche modèle).

5. Générez sur ce site

Ouvrez l’espace MiniMax Music 3. Mettez la caption dans le champ prompt / description. Mettez les paroles balisées en mode paroles. Passez en mode instrumental pour le Prompt D. Un run coûte 20 crédits.

Briefs à copier-coller (quatre métiers)

Ce sont des briefs d’espace originaux, pas des fichiers de templates copiés. Ne changez que les noms que vous possédez. Notez chaque take sur la structure, la tenue des paroles, l’ajustement vocal, la clarté d’arrangement, et une fin utilisable.

Prompt A — pop acoustique qui doit s’ouvrir

### Global Metadata
Genre: contemporary acoustic pop. Mid-tempo, unhurried pulse.
Intimate verse that opens into a wider, brighter final chorus.
Late-evening room, close-mic singer-songwriter production.

### Vocal Details
Soft female lead, close and breathy in the verse, clearer and more
supported in the chorus, light stacked harmonies only on the last chorus.
No rap, no choir wall.

### Arrangement
[Intro] fingerpicked guitar and a soft piano figure, no drums.
[Verse] guitar stays primary; piano answers between lines.
[Pre-Chorus] brushed kit and upright bass enter quietly.
[Chorus] drums and bass lock; guitar opens; piano widens.
[Verse] drop back toward the intro texture.
[Chorus] fuller than the first chorus.
[Outro] guitar and piano only, soft landing, no hard cutoff.

[Verse]
Morning light filtering through the pine
Every quiet street is yours and mine
[Chorus]
Softly the world begins to breathe
[Verse]
I keep the window cracked for the rain
[Chorus]
Softly the world begins to breathe
[Outro]
Leave the light on for the evening

Les deux premières lignes de paroles suivent le couplet d’exemple public MiniMax ; le reste est une courte feuille originale pour que le refrain puisse revenir (GitHub README).

Prompt B — R&B trap-soul, chanteur devant

### Global Metadata
Genre: contemporary R&B / trap soul. Slow-to-mid pocket, late-night.
Verse stays close and conversational; chorus opens without turning into EDM.
Headphones, dry-room vocal, polished but not glossy.

### Vocal Details
Mature male lead, warm baritone-tenor, intimate verse, fuller chorus.
Soft stacked backgrounds on the chorus only. No guest rap unless tagged.

### Arrangement
[Intro] electric piano and a muted guitar lick, 808 far back.
[Verse] hats stay quiet; bass is felt more than heard.
[Pre-Chorus] hats open a little; a second vocal layer appears.
[Chorus] 808 and clap land; keys widen; guitar stays decorative.
[Bridge] strip to keys and voice.
[Chorus] last chorus keeps the low end but does not add a festival drop.
[Outro] keys and a fading 808, no riser.

[Verse]
City lights smear on the window glass
I replay the message I should not have
[Pre-Chorus]
Tell me if the night is still honest
[Chorus]
Keep the low end under my voice
Do not let the drums start a fight
[Bridge]
If the hook comes back, let it come quiet
[Chorus]
Keep the low end under my voice
[Outro]
Leave the last note in the room

Prompt C — Mandopop / Asie de l’Est moderne, voix d’abord

### Global Metadata
Genre: modern Mandopop with restrained electronic R&B color.
Mid-slow ballad pulse. Tender verse, lifted but not shouted chorus.
Indoor night scene, warm vocal in front of room piano and light pads.

### Vocal Details
Clear female lead, speech-like verse, longer tones in the chorus.
Light doubles on the chorus. No English rap, no stadium gang vocals.

### Arrangement
[Intro] room piano and a distant guzheng figure.
[Verse] piano and a soft electronic pulse; guzheng answers phrases.
[Pre-Chorus] pads rise; kick stays soft.
[Chorus] full but still singer-first; strings enter under the last line.
[Verse] thinner than verse one.
[Chorus] slightly wider than the first chorus.
[Outro] piano and guzheng only.

[Verse]
屋檐下青苔长
木窗边月影扬
[Chorus]
岁月如歌 歌声悠长
我们牵手走过风霜
[Verse]
摇椅轻晃夕阳下
[Chorus]
岁月如歌 歌声悠长
[Outro]
人间烟火 平淡无瑕

Les échantillons officiels MiniMax incluent une ballade mandarine chaude et un cut jazz / soul de Shanghai ; ce brief est un point de départ d’espace, pas une promesse que chaque run collera à ces démos (blog MiniMax ; démo officielle).

Prompt D — instrumental ciné, pas de chanteur

### Global Metadata
Genre: cinematic orchestral cue, not a pop song.
Slow build from a thin solo line to a controlled mid-fortissimo, then release.
Trailer-adjacent, but no cheap brass stab every four bars.

### Vocal Details
Instrumental only. No lead singer, no choir lyric, no whispered vocal hook.
Low strings and a solo cello carry the melody.

### Arrangement
[Intro] solo cello, almost dry.
[Instrumental] violas and a quiet pulse enter; harp is decorative.
[Instrumental] low brass supports, percussion stays military-soft.
[Instrumental] peak without a jump-scare hit.
[Outro] cello alone, room tail, no hard cutoff.
[Instrumental]
[Outro]

Les docs officielles documentent un chemin instrumental dans l’ensemble caption / balises (tutoriel ComfyUI). Utilisez le mode instrumental dans l’espace pour que le modèle n’ait pas à inventer un chanteur.

Contrôles, échecs, checklist

Contrôles qui existent vraiment sur ce site

  • Modes prompt / paroles / instrumental dans l’espace
  • Un coût de 20 crédits affiché avant le run
  • Relecture bibliothèque plus téléchargement WAV / MP3 après une take finie

Échecs déjà signalés par les docs officielles

  • Balises et captions sont un contrôle génératif, pas une carte de tempo verrouillée ni une liste d’instruments garantie (fiche modèle)
  • L’auto-hébergement local est un autre métier (documenté autour de 24 Go pleine précision, environ 8 Go avec streaming de couches). Ce site est le chemin navigateur (fiche modèle)
  • La durée vendeur va jusqu’à cinq minutes ; les démos officielles de l’accueil tournent près de trois minutes. Ne lisez pas chaque run hébergé comme un rendu de cinq minutes (fiche modèle ; ComfyUI)

Checklist avant de dépenser les 20 crédits suivants

  1. Un nom de famille, pas cinq adjectifs empilés
  2. Genre du chanteur ou « instrumental only »
  3. Un instrument qui doit rester audible
  4. Balises sur leur propre ligne si vous avez des paroles
  5. Vous avez déjà entendu une démo d’accueil qui colle au métier

Ce que nous savons vs. ce que nous ne prétendons pas

| Nous savons (sourcé) | Nous ne savons pas / ne prétendons pas | | --- | --- | | Lancement open-weight de Music 3 le 2026-08-13 (blog MiniMax ; X) | Qu’une caption à trois blocs bat toujours une vibe d’une phrase sur chaque genre | | Skill officiel : 18 familles, ~1 000 modèles, bibliothèque texte statique (skills README) | Que le rewriter copie un ID de template dans votre morceau (on lui dit de ne pas le faire) | | Caption → instructions, paroles → input (GitHub README) | Que les runs hébergés ici exposent ces noms de champs API bruts dans l’UI | | Balises de section + caption = contrôle documenté, pas des garanties symboliques (fiche modèle) | Un verrou exact BPM / tonalité / instrument à chaque take | | Ce produit : 20 crédits par run, 20 crédits à l’inscription | Des tableaux d’achat dollar-par-chanson cross-canal |

FAQ

Faut-il le skill music-caption-rewriter pour utiliser MiniMax Music 3 ?

Non. Les docs officielles disent qu’une description concise en langage naturel peut servir directement. Le skill vise un contrôle plus riche, plus précis (fiche modèle ; skills README).

Comment générer des genres différents avec MiniMax Music 3 ?

Nommez une famille du routeur (pop, hip-hop, jazz, orchestral ciné, Asie de l’Est moderne, et le reste), puis écrivez Global Metadata + Vocal Details + Arrangement. Collez ça dans l’espace. Les mots d’humeur seuls routent vers le repli general pop / ballad (genre router).

Que mettre dans les paroles vs la description musicale ?

Paroles : les mots plus les balises de section. Description : style, émotion, voix, instruments, et comment l’arrangement change. Ne collez pas le même couplet dans les deux champs (GitHub README ; SKILL.md).

MiniMax Music 3 peut-il faire un instrumental ?

Oui. Dites instrumental dans la caption et utilisez le mode instrumental. Les matériaux officiels incluent [Instrumental] comme balise (ComfyUI). Le Prompt D est le point de départ à copier-coller.

Le modèle visera-t-il mon BPM et ma tonalité exacts ?

Pas en garantie. Les limites officielles disent que tempo, tonalité, instrumentation, paroles et structure peuvent dériver (fiche modèle). Préférez un feeling de tempo sauf si vous avez vraiment besoin d’un chiffre.

Ce site est-il officiel MiniMax ?

Non. minimaxmusic3.org est un produit indépendant. La recherche officielle est sur le blog MiniMax et Hugging Face. Nous hébergeons l’audio de démo public pour une référence avant de dépenser des crédits.

Comment marchent les crédits ici ?

Un run musical = 20 crédits. L’inscription offre 20 crédits, donc le premier morceau est couvert. Les suivants passent par un pack unique. Les runs échoués remboursent les crédits. Cet article ne compare pas les grilles des autres sociétés.

Puis-je utiliser un morceau généré à des fins commerciales ?

Les packs de crédits payants sur ce site incluent un usage commercial selon nos pages légales. Le morceau d’essai d’inscription est pour un test personnel. La Community License MiniMax est un contrat séparé si vous auto-hébergez les poids (LICENSE).

Par où commencer si je n’ai qu’une humeur ?

Jouez une démo d’accueil, puis lancez le Prompt A (pop vocale) ou le Prompt D (instrumental). Ajoutez qui chante et un instrument avant d’empiler les adjectifs.

Le skill réécrit-il mes paroles ?

Non. Règles officielles du skill : le texte des paroles n’est jamais reproduit ni réécrit ; seules les balises entre crochets agissent comme directives musicales (skills README).

Faut-il comparer les prix entre plateformes ici ?

Non. Décidez d’abord sur l’adéquation au métier et le taux de keeper, puis tarifiez sur la surface depuis laquelle vous livrez vraiment.

À propos de Quinn Sato

Quinn Sato écrit des flux musicaux : paroles, captions et briefs instrumentaux deviennent des workflows navigateur reproductibles sur MiniMax Music 3.

More Posts