Modèles
42 modèles, et à quoi sert chacun.
Ce que chacun accepte, ce qu’il produit, et ce qu’une exécution coûte en crédits, lu dans la table même que le composeur facture. Ouvrez-en un et sa page porte la grille tarifaire complète.
Images
Seedream 5 LiteByteDanceBest value
Le modèle d’image par défaut : peu cher, rapide, accepte sept références et offre sa résolution maximale.
A fast, inexpensive all-rounder that still takes seven references: the everyday default for product and lifestyle shots.
- Formats
- 1:1 4:3 3:4 16:9 9:16 3:2 2:3 21:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 3 crédits
Nano Banana 2Google
Le modèle d’image de Google, celui vers lequel se tourner quand le format est inhabituel.
Google's flagship image model: crisp legible text, faithful prompt-following, and clean edits from up to seven references.
- Formats
- 1:1 1:4 1:8 2:3 3:2 3:4 4:1 4:3 4:5 5:4 8:1 9:16 16:9 21:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 6 crédits
GPT Image 2OpenAI
Le modèle d’image d’OpenAI. Le meilleur ici pour suivre des consignes, avec un menu de qualité qui fait varier le prix d’un facteur onze.
OpenAI's image model: strong instruction-following and precise, mask-free edits when you need exactly what you described.
- Formats
- 1:1 3:2 2:3 4:3 3:4 16:9 9:16
- Images de référence
- 7
- Exécution la moins chère
- à partir de 1 crédit
Nano Banana 2 LiteGoogle
Les quatorze formats de Nano Banana à moitié prix, plafonnés en 1K.
The quickest, cheapest Nano Banana: the same look, trimmed for speed while you iterate.
- Formats
- 1:1 1:4 1:8 2:3 3:2 3:4 4:1 4:3 4:5 5:4 8:1 9:16 16:9 21:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 3 crédits
Seedream 5 ProByteDance
Seedream avec plus de capacité par passe, facturé à la taille plutôt que donné.
Seedream's top tier: richer detail and stronger prompt adherence for hero images and final renders.
- Formats
- 1:1 4:3 3:4 16:9 9:16 3:2 2:3 21:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 4 crédits
FLUX SchnellBlack Forest LabsCheapest
Un demi-crédit l’image. Le palier volume, quand il vous en faut vingt.
Black Forest Labs' speed build: pennies per image for quick text-to-image drafts and thumbnails.
- Formats
- 1:1 2:3 3:2 3:4 4:3 4:5 5:4 9:16 16:9 21:9
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 0,5 crédit
FLUX.2 FlexBlack Forest Labs
FLUX.2 avec plus de contrôle par passe, un cran au-dessus de Pro.
FLUX.2 with tunable quality-vs-cost: dial resolution up for finals or down to sketch cheaply.
- Formats
- 1:1 2:3 3:2 3:4 4:3 4:5 5:4 9:16 16:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 2,5 crédits
FLUX.2 ProBlack Forest Labs
Le cheval de trait de Black Forest Labs, et l’un des modèles à références les moins chers d’ici.
The production FLUX.2: dependable, detailed renders with reference support at a flat rate.
- Formats
- 1:1 2:3 3:2 3:4 4:3 4:5 5:4 9:16 16:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 2 crédits
FLUX.2 MaxBlack Forest Labs
Le haut de l’échelle FLUX.2, quand le rendu lui-même est le livrable.
The most capable FLUX.2: maximum fidelity and prompt control for demanding compositions.
- Formats
- 1:1 2:3 3:2 3:4 4:3 4:5 5:4 9:16 16:9
- Images de référence
- 7
- Exécution la moins chère
- à partir de 5 crédits
RRecraft V4.1 SVGRecraft
La seule façon d’obtenir un vectoriel modifiable dans ce catalogue. Logos, icônes, illustration à plat.
Generates real, editable vector art: logos, icons, and illustrations that scale to any size.
- Formats
- 1:1 2:3 3:2 3:4 4:3 4:5 5:4 9:16 16:9
- Images de référence
- Non acceptées
- Sortie
- SVG (vectoriel modifiable)
- Exécution la moins chère
- à partir de 3,5 crédits
RRecraft V4.1 Pro SVGRecraft
Recraft en 2048×2048 : plus de détail dans les tracés, à six fois le prix du palier standard.
Recraft's pro vector tier: cleaner paths and finer detail for brand-ready SVG assets.
- Formats
- 1:1 2:3 3:2 3:4 4:3 4:5 5:4 9:16 16:9
- Images de référence
- Non acceptées
- Sortie
- SVG (vectoriel modifiable)
- Exécution la moins chère
- à partir de 21 crédits
P-ImagePruna AICheapest
Un demi-crédit, sortie JPEG. L’autre palier volume.
Pruna's efficiency-tuned image model: quick, budget-friendly text-to-image.
- Formats
- 1:1 4:3 3:4 16:9 9:16 3:2 2:3
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 0,5 crédit
Grok Imagine ImagexAI
Le modèle d’image de xAI. Deux crédits, et une image en entrée pour une retouche plutôt qu’un jeu de références.
xAI's image model: inexpensive prompt-to-image, and one picture in for an edit rather than a whole reference set.
- Formats
- 1:1 16:9 9:16 4:3 3:4 3:2 2:3
- Images de référence
- 1
- Exécution la moins chère
- à partir de 2 crédits
Grok Imagine Image QualityxAI
Le Grok plus net : sortie 2K, meilleur rendu du texte, et une résolution qui est toute la décision.
The sharper Grok Imagine: finer detail and better text rendering, with 2K output on tap.
- Formats
- 1:1 16:9 9:16 4:3 3:4 3:2 2:3
- Images de référence
- 1
- Exécution la moins chère
- à partir de 4,5 crédits
Clips
Seedance 2.5ByteDanceUp to 30-second take
Trente images de référence, dix vidéos de référence, dix audios de référence, et jusqu’à trente secondes.
ByteDance's flagship: a full 30 seconds in one pass, with native audio and up to thirty image, ten video, and ten audio references.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 480p 720p
- Durée
- 4–30 secondes
- Images de référence
- 30
- Exécution la moins chère
- à partir de 43 crédits
Seedance 2.0ByteDance
La génération Seedance précédente, et le seul modèle ici qui rende en 4K.
The previous Seedance: multimodal control from image, video and audio references, and the only one that still reaches 4K.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 480p 720p 1080p 4K
- Durée
- 4–15 secondes
- Images de référence
- 9
- Exécution la moins chère
- à partir de 33,5 crédits
Seedance 2.0 MiniByteDanceCheapest
Le Seedance économique : mêmes références et même plafond, limité au 720p.
The lowest-cost Seedance: full multimodal reference control and native audio for high-volume drafts and prototypes.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 480p 720p
- Durée
- 4–15 secondes
- Images de référence
- 9
- Exécution la moins chère
- à partir de 17 crédits
Seedance 2.0 FastByteDance
Seedance 2.0 réglé pour le délai plutôt que pour le prix.
The speed-focused Seedance: the same multimodal controls with quicker turnaround for rapid iteration.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 480p 720p
- Durée
- 4–15 secondes
- Images de référence
- 9
- Exécution la moins chère
- à partir de 29,5 crédits
Grok Imagine Video 1.5xAI
Le modèle de clip de xAI. Exige une image de départ, et génère toujours du son.
xAI's image-to-video preview model: animate a still into a short clip with synchronized music, effects, and ambience.
- Formats
- 16:9 9:16 1:1 4:3 3:4 3:2 2:3
- Résolutions
- 480p 720p
- Durée
- 1–15 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 33,5 crédits
Veo 3.1GoogleNative audio
Le fleuron de Google : génère dialogues et son à partir du même prompt que l’image.
Google Veo with synchronized, natively generated sound: dialogue and effects baked into the clip.
- Formats
- 16:9 9:16
- Résolutions
- 720p 1080p
- Durée
- 4, 6, 8 secondes
- Images de référence
- 3
- Exécution la moins chère
- à partir de 83,5 crédits
Veo 3.1 FastGoogle
Veo sans références, à environ un tiers du prix. L’outil du plan unique.
A faster, cheaper Veo 3.1 for rapid drafts before you commit to a full render.
- Formats
- 16:9 9:16
- Résolutions
- 720p 1080p
- Durée
- 4, 6, 8 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 42 crédits
Veo 3.1 LiteGoogleCheapest
Le palier volume de la famille Veo. L’audio est obligatoire ; le 1080p ne tourne qu’à huit secondes.
Google's lowest-cost Veo: native dialogue, effects, and ambience for high-volume drafts and social clips.
- Formats
- 16:9 9:16
- Résolutions
- 720p 1080p
- Durée
- 4, 6, 8 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 21 crédits
Kling v3 OmniKuaishou
Le fleuron de Kuaishou : sept références, une vidéo de référence, et une sortie 4K.
Kling's omni model: strong motion and lip-sync from images plus a reference video, up to 4K.
- Formats
- 16:9 9:16 1:1
- Résolutions
- 720p 1080p 4K
- Durée
- 3–15 secondes
- Images de référence
- 7
- Exécution la moins chère
- à partir de 70 crédits
AHappyHorse 1.0AlibabaBest value
Le modèle de clip d’Alibaba. Prompt seul, cinq formats, jusqu’à quinze secondes.
Alibaba's image-to-video model: smooth, affordable animation from a single first frame.
- Formats
- 16:9 9:16 1:1 4:3 3:4
- Résolutions
- 720p 1080p
- Durée
- 3–15 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 58,5 crédits
RRunway Gen-4.5Runway
Le modèle de Runway. 1080p uniquement, cinq ou dix secondes, six formats.
Runway Gen-4.5: cinematic camera moves and consistent motion at a flat per-second rate.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 1080p
- Durée
- 5, 10 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 50 crédits
P-VideoPruna AICheapest
Le modèle de clip généraliste de Pruna. Peu cher, durées souples, un audio de référence.
Pruna's quick all-rounder for text-to-video, image-to-video, or clips conditioned by your own audio.
- Formats
- 16:9 9:16 4:3 3:4 3:2 2:3 1:1
- Résolutions
- 720p 1080p
- Durée
- 1–10 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 8,5 crédits
FLUX 3Black Forest Labs
Le modèle de clip de Black Forest Labs. L’image et le son depuis un seul prompt en langage courant, jusqu’à vingt secondes.
Black Forest Labs' multimodal model: one prompt makes the picture and its sound, from nothing at all or from a frame you hand it.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 720p 1080p
- Durée
- 5–20 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 71 crédits
MMiniMax H3 MaxMiniMax
Le réentraînement de MiniMax H3 par fal. Quinze secondes, audio natif, et presque rien à régler.
MiniMax's H3, retuned by fal: a prompt, an optional Start and End frame, and up to fifteen seconds that arrive with their own sound.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 480p 768p
- Durée
- 5–15 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 21 crédits
P-Video AvatarPruna AILip sync
Une photo et une piste audio deviennent un clip parlant. Le prompt est facultatif.
Turn one portrait into a presenter: attach a voice-over and the face speaks it, with natural mouth and expression.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 720p 1080p
- Durée
- 1–15 secondes
- Images de référence
- 1
- Exécution la moins chère
- à partir de 10,5 crédits
P-Video AnimatePruna AI
Prend une image fixe et une vidéo pilote, et fait bouger la fixe comme la vidéo.
Recast a shot: your subject performs the motion and audio of a source video. Built for spinning one asset into many UGC variations.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 720p 1080p
- Durée
- 1–15 secondes
- Images de référence
- 1
- Exécution la moins chère
- à partir de 12,5 crédits
P-Video ReplacePruna AI
Remplace le sujet dans des images filmées existantes par le vôtre.
Swap the people in an existing shot while keeping its motion, timing, camera, scene, and optional source audio intact.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 720p 1080p
- Durée
- 1–15 secondes
- Images de référence
- 3
- Exécution la moins chère
- à partir de 12,5 crédits
OmniHuman 1.5ByteDance
Le modèle d’interprétation de ByteDance : un portrait et une piste audio, en 1080p avec de vrais mouvements du corps.
ByteDance's film-grade digital human: micro-expressions, gestures, and camera moves that follow the meaning of the audio, not just its syllables.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 1080p
- Durée
- 1–15 secondes
- Images de référence
- 1
- Exécution la moins chère
- à partir de 67 crédits
Kling Avatar v2Kuaishou
Un portrait et une piste audio deviennent un clip parlant — personnes, animaux ou dessins animés, en 720p.
Kling's talking avatar: a portrait and a voice track become a performance — humans, animals, cartoons and stylised characters alike.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 720p
- Durée
- 1–15 secondes
- Images de référence
- 1
- Exécution la moins chère
- à partir de 22 crédits
Kling Motion ControlKuaishou
Anime une image fixe avec le mouvement d’une vidéo. Prompt facultatif, 720p ou 1080p.
Kling 3.0's motion transfer: your character performs a source video's action, holding identity, scene, and quality across the take.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 720p 1080p
- Durée
- 3–15 secondes
- Images de référence
- 1
- Exécution la moins chère
- à partir de 29,5 crédits
Kling Lip SyncKuaishouCheapest
Six crédits : resynchronise une personne dans des images existantes sur une nouvelle piste audio.
Re-syncs the mouth of a clip you already have to new speech: attach a voice-over, or let the prompt be the script. Two to ten seconds.
- Formats
- 16:9 4:3 1:1 3:4 9:16 21:9
- Résolutions
- 1080p
- Durée
- 2–10 secondes
- Images de référence
- Non acceptées
- Exécution la moins chère
- à partir de 6 crédits
Voix
‖Eleven v3ElevenLabs
La voix la plus expressive du catalogue, et la seule que l’on dirige en écrivant des indications de jeu dans la réplique.
- Voix
- 26
- Langues
- 29
- Limite de texte
- 3 000 caractères
- Exécution la moins chère
- à partir de 8,5 crédits
Gemini 3.1 Flash TTSGoogle
Trente voix dans vingt-cinq langues, par Google.
- Voix
- 30
- Langues
- 25
- Limite de texte
- 4 000 caractères
- Exécution la moins chère
- à partir de 11 crédits
KKokoro 82MKokoro
Trente-trois voix aux accents anglais, tarifées pour le volume.
- Voix
- 33
- Limite de texte
- 4 000 caractères
- Exécution la moins chère
- à partir de 0,5 crédit
MMiniMax Speech 2.8 HDMiniMax
La plus dirigeable : sélecteur d’émotion, contrôle de vitesse, vingt-quatre langues.
- Voix
- 17
- Langues
- 24
- Limite de texte
- 4 000 caractères
- Exécution la moins chère
- à partir de 4,5 crédits
IInworld TTS 2.0inworld
Quatre voix, seize langues, réglées pour la diffusion en temps réel.
- Voix
- 4
- Langues
- 16
- Limite de texte
- 2 000 caractères
- Exécution la moins chère
- à partir de 2,5 crédits
Musique
MMiniMax Music 2.6MiniMax
Du prompt au morceau, et le seul modèle de musique ici qui chante.
- Exécution la moins chère
- à partir de 12,5 crédits
‖Eleven MusicElevenLabs
Une minute d’habillage instrumental par prise, depuis un modèle entraîné sur de la musique sous licence.
- Exécution la moins chère
- à partir de 12,5 crédits