ByteDance · Clips · premium
OmniHuman 1.5
Le modèle d’interprétation de ByteDance : un portrait et une piste audio, en 1080p avec de vrais mouvements du corps.
Ce qu’il coûte
| 5s | 67 crédits |
Ce qu’il accepte
| Formats | 16:9 4:3 1:1 3:4 9:16 21:9 |
| Résolutions | 1080p |
| Durée | 1–15 secondes |
| Images de référence | 1 |
| Audio de référence | 1 |
| Audio | Toujours généré |
| Entrées requises | image, audio |
Quand y aller
La version haute fidélité du clip de personne qui parle. Comme P-Video Avatar, il lui faut une image et une piste audio, et il anime la personne pour qu’elle parle, mais il rend en 1080p uniquement, et il fait bouger bien plus que la bouche. Gestes, posture et mouvements de tête répondent tous à l’audio, ce qui fait la différence entre un clip qui se lit comme une interprétation et un clip qui se lit comme une photo à la mâchoire mobile.
Il coûte plusieurs fois ce que coûte Avatar pour la même durée, et c’est toute la décision. Pour une réplique à l’intérieur d’une séquence plus longue, ou pour tout ce où la personne est le sujet plutôt qu’un élément parlant dans un coin, la différence est assez visible pour le justifier. Pour du volume, vingt répliques courtes ou un plan provisoire ou un visage dans un montage, non.
La durée suit l’audio jusqu’à quinze secondes. Une image de référence, un audio de référence, et le son est toujours généré. Six formats : le vertical et le carré fonctionnent tous les deux.
Comparé à
- P-Video Avatar vs OmniHuman 1.5
Avatar pour le volume et pour les visages d’arrière-plan. OmniHuman quand la personne est le sujet.
OmniHuman 1.5 est à un clic dans le composeur.
Tous les modèles de ce catalogue partent de la même barre de prompt, payés dans les mêmes crédits. Les nouveaux comptes démarrent avec de quoi dépenser.
Créez maintenant