
AI API untuk pengembang
API Gambar ke Video
Menganimasikan foto, potret, dan karya seni produk dengan API Gambar ke Video PoYo. Bandingkan model video, kontrol bingkai referensi, gerakan, pengaturan output, dan harga untuk alur kerja pengembang.
Model yang cocok
40 model

$0.105 /detik
hailuo-03
MiniMax H3 (Hailuo 03) generates native 2K video from text, first/last frames, or image, video, and audio references.

$0.085 /detik yang ditagih
seedance-2.5
ByteDance Seedance 2.5 video generation with 4-30 second output, first and last frame control, up to 50 image, video, and audio references, optional synchronized audio, and 480p, 720p, or 1080p delivery.

$0.17 /detik
flux-3/text-to-video
Black Forest Labs' FLUX 3 video family for text, images, first and last frames, source-video extension, positioned keyframes, and native audio generation.

$0.045 /detik video keluaran dan referensi
seedance-2
ByteDance Seedance 2 video generation with text-to-video, image-to-video, multimodal reference-to-video, video-to-video, and audio-to-video workflows using image, video, and audio references with optional native audio.

$0.225 /generasi
gemini-omni-1.1-flash
Gemini Omni 1.1 Flash API for text-to-video, first and last frame interpolation, reference image generation, and reference-video workflows.

$0.03 /detik video keluaran dan referensi
seedance-2-mini
ByteDance Seedance 2.0 Mini video generation for lower-cost text-to-video, image-to-video, and multimodal reference workflows with 480p and 720p output.

$0.045 /detik
kling-3.0-motion-control
Kling 3.0 Motion Control is a reference-driven motion transfer model that combines one character image and one source video with transparent per-second pricing.

$0.11 /detik
happy-horse-1.1
Alibaba Happy Horse 1.1 video generation with text-to-video, image-to-video, and reference-to-video workflows.

$0.135 /detik
kling-3.0/standard
Kuaishou's advanced Kling 3.0 video model family with Standard, Pro, and native 4K generation, multi-shot storyboarding, synchronized audio, and element-based consistency.

$0.05 /detik
kling-o3/standard
Kling O3 video generation on PoYo with Standard, Pro, and 4K variants for text-to-video, image-to-video, and reference-to-video workflows.

$0.20 /video
sora-2-official
OpenAI Sora 2 on PoYo with synced audio, improved physics, optional reference image input, and fixed 4-second, 8-second, 12-second, 16-second, and 20-second tiers.

$0.06 /detik
wan2.7-text-to-video
Wan 2.7 Video models on PoYo for text-to-video, image-to-video, reference-to-video, and edit-video workflows.

$0.05 /detik
wan3.0-text-to-video
Generate videos up to 30 seconds with Wan 3.0 using text, first and last frames, or multimodal references including images, video, audio, documents, and links.

$0.068 /detik
wan3.0-prime-text-to-video
Wan 3.0 Video Prime is Alibaba's Wan 3.0 tier optimized for faster turnaround, with multimodal image, video, audio, document, and public webpage references, videos up to 30 seconds, and optional generated audio.

Akan segera datang.
Wan Animate 2
Alibaba's end-to-end character animation model for direct motion transfer, identity preservation, and text-driven viewpoint control. Coming soon to PoYo.

Akan segera datang.
Kling 4.0
Kling 4.0 brings 30-second cinematic video, 4K output, multi-keyframe control, multimodal references, and native stereo audio to creative workflows.

Akan segera datang.
Kling 4.0 Flash
Kling 4.0 Flash brings fast 720p video creation up to 20 seconds, native audio, and Omni Reference for text, image, and multimodal creative workflows.

$0.05 /detik
h3-max
MiniMax H3 Max generates 5–15 second videos from text, first/last frames, or image, video and audio references at 480p, 768p and 1080p.

$0.025 /detik
h3-max-turbo
MiniMax H3 Max Turbo generates 5–15 second videos from text or first/last frames at 480p, 768p and 1080p.

$0.03 /gambar
grok-imagine-image
xAI's Aurora-powered visual AI for image generation and video creation with Fun, Normal, and Spicy creative modes.

$0.035 /detik
hailuo-02
MiniMax's #2 globally-ranked video model with NCR architecture, ultra-realistic physics, and 1080p cinematic output.

$0.10 /video
veo3.1-lite
Google DeepMind's VEO 3.1 video family with text-to-video, image-to-video, 720p, 1080p, and 4K output options.

$0.018 /detik
veo3.1-fast-official
Official VEO 3.1 video generation with text, image, first/last-frame and reference workflows across fast, lite and quality tiers.

$0.03 /generasi
wan2.2-image-to-video-fast
Wan 2.2 Fast provides fast text-to-video and image-to-video generation with low-cost 480p and 720p tiers for quick iteration.

$0.072 /detik
grok-imagine-video-1.5
Grok Imagine Video 1.5 API for text-to-video, single-frame image-to-video, and 1–7 image reference-to-video generation with up to 1080p output.

$0.175 /video
hailuo-2.3
MiniMax's Hailuo 2.3 video model for realistic human motion, expressive characters, and text-to-video or first-frame guided generation at 768p and 1080p.

$0.60 /generasi
omni-flash
Omni Flash API access for text-to-video, image-to-video, three-image reference fusion, and video-input generation workflows.

$0.105 /video
seedance-1.0-pro
ByteDance's #1 ranked video model with multi-shot storytelling, cinema-grade motion, and bilingual text-to-video generation.

$0.045 /video
seedance-1.5-pro
ByteDance's latest video model with synchronized audio generation, flexible aspect ratios, and enhanced motion control.

$0.15 /video
wan2.5-image-to-video
Wan 2.5 combines text-to-video and image-to-video generation with 5-second and 10-second output, synchronized audio support, and multiple size and resolution tiers.

$0.045 /detik
kling-1.6/standard
Kling 1.6 Standard and Pro video generation on PoYo with text, first/last frame, and multi-image element reference workflows.

$0.15 /video
kling-2.1/standard
Kling 2.1 on PoYo provides Standard and Pro image-to-video modes with 5-second and 10-second clips, start-frame control, and optional end-frame control in Pro.

$0.325 /video
kling-2.6
Kuaishou's revolutionary video model that simultaneously generates visuals with synchronized dialogue, sound effects, and ambient audio in one pass.
$0.035 /detik
kling-avatar-2.0/standard
Kling Avatar 2.0 creates audio-driven talking avatar videos from one reference image and one driving audio file, with Standard and Pro quality modes.

$0.40 /video
wan2.6-text-to-video
Alibaba's Wan 2.6 video generation family for text-to-video, image-to-video, and video-to-video with multi-shot 1080p output.

$0.21 /video
kling-2.5-turbo-pro
Kling 2.5 Turbo Pro is a flexible short-form video model with text-to-video, optional frame guidance, smooth motion, cinematic depth, and fixed 5-second and 10-second tiers.

$0.085 /detik
kling-3.0-turbo/standard
Kling 3.0 Turbo is the speed-optimized Kling 3.0 variant for high-volume text-to-video and image-to-video generation with multi-shot storyboarding. Standard (720p) and Pro (1080p) models available.

$0.035 /detik
wan-animate-move
Alibaba's 14B-parameter character animation model that transfers motion from reference videos to static characters with exceptional identity preservation.

$0.04 /detik
kling-2.6-motion-control
Kuaishou's motion control model that transfers motion from reference videos to character images while maintaining identity and adapting environments.

$0.08 /detik
happy-horse
Alibaba Happy Horse 1.0 video generation and editing with text-to-video, image-to-video, reference-to-video, and video-edit workflows.
Gambar ke video Model API - Harga dan Model yang Cocok
Bandingkan penyedia, masukan yang didukung, format keluaran dan harga sebelum memilih model.
Cocok dengan tugas
Model muncul di sini hanya jika katalog metadata mereka termasuk Image to Video.
Perbandingan penyedia
Ulasan keluarga model di seluruh penyedia tanpa meninggalkan direktori tugas.
API-jalan siap
Setiap kartu model menghubungkan ke PoYo harga, contoh, kontrol taman bermain dan API details.
| Model | Penyedia | Jenis tugas | Harga |
|---|---|---|---|
| MiniMax H3 / Hailuo 03 hailuo-03 | MiniMax | Text to Video, Image to Video | $0.105/detik |
| Seedance 2.5 seedance-2.5 | Seedance | Text to Video, Image to Video, Video to Video | $0.085/detik yang ditagih |
| FLUX 3 flux-3/text-to-video | Black Forest Labs | Text to Video, Image to Video | $0.17/detik |
| Seedance 2 seedance-2 | Seedance | Text to Video, Image to Video, Video to Video | $0.045/detik video keluaran dan referensi |
| Gemini Omni 1.1 Flash gemini-omni-1.1-flash | Text to Video, Image to Video, Video to Video | $0.225/generasi | |
| Seedance 2.0 Mini seedance-2-mini | Seedance | Text to Video, Image to Video, Video to Video | $0.03/detik video keluaran dan referensi |
| Kling 3.0 Motion Control kling-3.0-motion-control | Kling | Motion Control, Image to Video | $0.045/detik |
| Happy Horse 1.1 happy-horse-1.1 | Alibaba | Text to Video, Image to Video, Uncensored | $0.11/detik |
| Kling 3.0 kling-3.0/standard | Kling | Text to Video, Image to Video | $0.135/detik |
| Kling O3 kling-o3/standard | Kling | Text to Video, Image to Video | $0.05/detik |
| Sora 2 Official sora-2-official | OpenAI | Text to Video, Image to Video | $0.20/video |
| Wan 2.7 Video wan2.7-text-to-video | Alibaba | Text to Video, Image to Video, Uncensored | $0.06/detik |
| Wan 3.0 wan3.0-text-to-video | Alibaba | Text to Video, Image to Video, Uncensored | $0.05/detik |
| Wan 3.0 Video Prime wan3.0-prime-text-to-video | Alibaba | Text to Video, Image to Video, Uncensored | $0.068/detik |
| Wan Animate 2 wan-animate-2 | Alibaba | Image to Video | Akan segera datang. |
| Kling 4.0 kling-4-0 | Kling | Text to Video, Image to Video | Akan segera datang. |
| Kling 4.0 Flash kling-4-0-flash | Kling | Text to Video, Image to Video | Akan segera datang. |
| MiniMax H3 Max h3-max | MiniMax | Text to Video, Image to Video | $0.05/detik |
| MiniMax H3 Max Turbo h3-max-turbo | MiniMax | Text to Video, Image to Video | $0.025/detik |
| Grok Imagine grok-imagine-image | xAI | Text to Image, Image to Video, Uncensored | $0.03/gambar |
| Hailuo 02 hailuo-02 | MiniMax | Text to Video, Image to Video | $0.035/detik |
| Veo 3.1 veo3.1-lite | Text to Video, Image to Video | $0.10/video | |
| Veo 3.1 Official veo3.1-fast-official | Text to Video, Image to Video | $0.018/detik | |
| Wan 2.2 Fast wan2.2-image-to-video-fast | Alibaba | Text to Video, Image to Video | $0.03/generasi |
| Grok Imagine Video 1.5 grok-imagine-video-1.5 | xAI | Image to Video | $0.072/detik |
| Hailuo 2.3 hailuo-2.3 | MiniMax | Text to Video, Image to Video | $0.175/video |
| Omni Flash omni-flash | Text to Video, Image to Video, Video to Video | $0.60/generasi | |
| Seedance 1.0 Pro seedance-1.0-pro | Seedance | Text to Video, Image to Video | $0.105/video |
| Seedance 1.5 Pro seedance-1.5-pro | Seedance | Text to Video, Image to Video | $0.045/video |
| Wan 2.5 wan2.5-image-to-video | Alibaba | Text to Video, Image to Video | $0.15/video |
| Kling 1.6 kling-1.6/standard | Kling | Text to Video, Image to Video | $0.045/detik |
| Kling 2.1 kling-2.1/standard | Kling | Image to Video | $0.15/video |
| Kling 2.6 kling-2.6 | Kling | Text to Video, Image to Video | $0.325/video |
| Kling Avatar 2.0 kling-avatar-2.0/standard | Kling | Image to Video, Audio to Video, Talking Avatar | $0.035/detik |
| Wan 2.6 wan2.6-text-to-video | Alibaba | Text to Video, Image to Video, Video to Video | $0.40/video |
| Kling 2.5 Turbo Pro kling-2.5-turbo-pro | Kling | Text to Video, Image to Video | $0.21/video |
| Kling 3.0 Turbo kling-3.0-turbo/standard | Kling | Text to Video, Image to Video | $0.085/detik |
| Wan Animate wan-animate-move | Alibaba | Image to Video | $0.035/detik |
| Kling 2.6 Motion Control kling-2.6-motion-control | Kling | Image to Video, Motion Control | $0.04/detik |
| Happy Horse happy-horse | Alibaba | Text to Video, Image to Video, Uncensored | $0.08/detik |
Pertanyaan yang sering diajukan
Apa itu API Gambar ke Video?
+
API gambar ke video menggunakan gambar diam sebagai titik awal atau referensi visual untuk video yang dihasilkan. Aplikasi Anda menyediakan gambar dan pengaturan yang didukung, sering kali dengan perintah gerakan. Hasilnya adalah klip baru, bukan tayangan slide sederhana atau jaminan rekonstruksi bingkai demi bingkai.
Gambar mana yang paling cocok untuk pembuatan gambar ke video?
+
Gunakan gambar yang tajam dengan subjek yang jelas, pembingkaian yang masuk akal, dan detail yang terlihat. Berikan ruang untuk gerakan yang Anda inginkan dan hindari tumpang tindih yang membingungkan atau sumber yang sangat terkompresi. Untuk suatu produk, buatlah label dan tepian yang penting mudah dilihat; untuk potret, mulailah dengan wajah jernih dan potongan yang sesuai.
Bagaimana cara menulis perintah gambar ke video?
+
Fokus pada apa yang harus bergerak dan apa yang harus tetap stabil. Jelaskan gerakan subjek, pergerakan kamera, dan suasana, alih-alih mengulangi setiap detail yang sudah terlihat dalam gambar. Mulailah dengan tindakan sederhana, periksa hasilnya, lalu ubah instruksi satu per satu.
Bolehkah saya menyediakan frame pertama dan frame terakhir?
+
Beberapa titik akhir gambar ke video mendukung bingkai awal dan akhir, sementara yang lain hanya menerima gambar awal atau mode referensi berbeda. Periksa bidang yang didokumentasikan dan batas gambar. Pilih bingkai yang menggambarkan transisi yang masuk akal; subjek atau komposisi yang sangat berbeda dapat mempersulit interpolasi.
Mengapa wajah, produk, atau logo berubah di video?
+
Generasi memprediksi pandangan dan gerakan baru dari informasi visual yang terbatas, sehingga detail kecil bisa melayang. Cobalah gambar sumber yang lebih jelas, gerakan yang lebih lembut, dan perintah yang mempertahankan subjek secara eksplisit. Bandingkan model yang menggunakan aset yang sama, dan tinjau detail penting bagi merek sebelum dipublikasikan.
Bisakah saya mengontrol kamera dengan API gambar ke video?
+
Anda dapat mendeskripsikan perilaku kamera secara cepat, dan beberapa model menampilkan kontrol khusus. Konfirmasikan opsi mana yang didukung titik akhir sebelum menambahkan parameter. Gunakan satu gerakan yang jelas, seperti push-in atau pan yang lambat, dan evaluasi apakah gerakan tersebut mempertahankan subjek serta menghasilkan bidikan yang diinginkan.
Bisakah video yang dihasilkan menyertakan audio?
+
Dukungan audio bersifat khusus model. Beberapa titik akhir menghasilkan suara asli, beberapa menjadikan audio opsional, dan yang lainnya mengembalikan video senyap. Periksa model dan tingkat harga yang dipilih. Untuk potret lisan, Avatar Berbicara mungkin lebih tepat; untuk narasi yang tepat, langkah Text to Speech terpisah dapat disesuaikan dengan alur kerja.
Bagaimana cara memilih durasi, resolusi, dan rasio aspek video?
+
Gunakan hanya nilai yang didokumentasikan untuk model yang dipilih. Cocokkan potongan dengan penempatan akhir dan pastikan gambar sumber sesuai. Klip yang lebih panjang dan resolusi yang lebih tinggi dapat mengubah perilaku biaya dan pembuatan, jadi bandingkan pengaturan draf praktis sebelum melakukan batch besar.
Bagaimana cara mengambil video setelah mengirimkan gambar?
+
Kirimkan input model dan gambar melalui pembuatan PoYo, simpan task_id dan lacak tugas hingga selesai. Gunakan titik akhir status atau callback_url yang didukung, lalu baca hasil videonya. Simpan gambar asli dan minta pengaturan dengan tugas sehingga pengguna dapat membandingkan versi yang dihasilkan.
Berapa biaya permintaan API gambar ke video?
+
Periksa harga model yang dipilih dan unit penagihan: video mungkin dikenakan biaya per klip, generasi, atau detik. Resolusi, durasi, kualitas, dan audio dapat memengaruhi tingkat yang berlaku. Perkirakan konfigurasi lengkap yang diminta dan jumlah percobaan daripada menerapkan satu harga awal untuk setiap video.
Haruskah saya menggunakan Gambar ke Video, Kontrol Gerakan, atau Avatar Berbicara?
+
Gunakan Gambar ke Video untuk menambahkan gerakan ke visual diam. Pilih Kontrol Gerakan ketika gerakan harus mengikuti video referensi. Pilih Avatar Berbicara ketika potret harus mengucapkan trek audio yang disediakan. Tugas-tugas ini mungkin tumpang tindih dalam output, namun input dan kontrol yang diperlukan berbeda.
Apa yang harus saya periksa sebelum mengotomatiskan permintaan gambar ke video?
+
Konfirmasikan aksesibilitas URL sumber, format gambar yang didukung, pemotongan, durasi, dan ID model. Simpan setiap ID tugas, kendalikan pengiriman secara bersamaan, dan periksa kesalahan sebelum mencoba lagi. Mulailah dengan sekumpulan kecil gambar yang representatif untuk memeriksa pelestarian subjek dan biaya produksi klip yang dapat diterima.
Menjelajahi semua model AI
Buka pasar model penuh untuk membandingkan gambar, video, audio, chat, 3D dan model alat.
Lihat semua modelMembangun dengan API
Buka halaman model untuk parameter, harga dan dokumentasi API.
Dokumentasi APIHalaman tugas yang terkait