Memberi suara pada video AI — BGM dan efek suara untuk era ComfyUI dan Hailuo
Pembuatan video AI meluas pesat pada 2026. ComfyUI dapat dijalankan secara lokal, MiniMax menawarkan kecepatan dan daya ekspresi, sedangkan alat cloud seperti Kling, Runway, Luma, dan Veo membuat siapa pun kini dapat membuat shot berdurasi beberapa detik.
Namun, «dapat membuat gambar» dan «hasilnya memiliki suara» adalah dua hal berbeda, dan batasnya bergantung pada model. Artikel ini menjelaskan bagaimana video AI dibuat saat ini, mengapa suara ditambahkan secara terpisah, serta suara seperti apa yang dibutuhkan setiap jenis video YouTube; kemudian menyajikan BGM dan efek suara arcalune yang sesuai. Semuanya dapat diunduh untuk penggunaan komersial tanpa wajib mencantumkan kredit.
Cara daftar ini dipilih
- Semua yang tercantum adalah BGM dan efek suara yang didistribusikan oleh arcalune. Kami tidak mempromosikan alat video AI itu sendiri atau mendistribusikan ulang audio milik pihak lain.
- Kami mengelompokkan trek berdasarkan genre video AI yang dipublikasikan di YouTube dan memilihnya dari cara setiap genre dibuat serta suara yang dibutuhkannya.
- Nama dan versi alat serta ada atau tidaknya keluaran audio didasarkan pada fakta yang dapat diverifikasi per Agustus 2026. Spesifikasi dapat berubah, jadi periksa sumber resmi setiap alat untuk informasi terbaru.
- Semuanya dapat diunduh untuk penggunaan komersial tanpa wajib mencantumkan kredit.
Cara video AI dibuat pada 2026
Proses pembuatannya terbagi menjadi dua lapisan besar. Lapisan pertama menjalankan ComfyUI pada GPU lokal: Wan 2.2 yang kuat untuk gerakan besar dan kerja kamera (versi 5B berjalan dengan kebutuhan VRAM lebih rendah), HunyuanVideo 1.5 untuk live-action, anime, dan 3DCG, serta LTX-2.5 yang mendukung audio tersinkron dan multishot native (satu generasi menghasilkan beberapa shot terhubung sambil mempertahankan karakter dan pencahayaan). Lapisan kedua adalah cloud/API, tempat MiniMax, Kling, Runway, Luma, Veo dari Google, dan Seedance dari ByteDance menghasilkan shot berdurasi beberapa hingga puluhan detik dari teks atau gambar.
Model video MiniMax Hailuo 2.3 (Oktober 2025) kuat dalam gerakan seluruh tubuh, representasi fisika, dan ekspresi halus, serta mendukung gaya anime, lukisan tinta, dan CG gim. MiniMax H3 yang dirilis pada 31 Juli 2026 adalah model berbeda yang menghasilkan video hingga 15 detik dalam 2K bersama audio stereo serta mempertahankan karakter dan gaya dari gambar, video, dan audio referensi. Sebagai pedoman: gunakan Wan / HunyuanVideo untuk mengendalikan gaya dan karakter secara rinci di lingkungan lokal, Hailuo 2.3 untuk kecepatan dan fisika, serta MiniMax H3, LTX-2.5, atau Veo jika audio juga ingin dibuat dalam satu proses.
Model tanpa suara dan model penghasil audio hadir berdampingan
Penanganan audio terbagi menjadi tiga jenis. (1) Hanya video: generasi standar Wan 2.2, HunyuanVideo 1.5, Hailuo 2.3, Runway Gen-4.5, Luma, dan Pika. (2) Video yang digerakkan oleh audio yang sudah ada: Wan 2.2-S2V (menyesuaikan gerak mulut dan akting dengan audio, tetapi tidak membuat suaranya). (3) Video dan audio dibuat bersamaan: MiniMax H3, LTX-2.5, Google Veo 3.1, Kling 3.0, dan ByteDance Seedance 2.5. Setiap alat dalam kelompok (1) memiliki fungsi terpisah sejenis «Add Audio» untuk menambahkan suara setelah generasi. Hal ini sendiri membuktikan bahwa produksi video tetap memerlukan tahap audio pascaproduksi. Sora dari OpenAI menghasilkan video dengan audio, tetapi versi web dan aplikasinya berakhir pada 26 April 2026, sementara API dijadwalkan berakhir pada 24 September 2026.
«Dapat menghasilkan audio» bukan berarti «tidak memerlukan BGM». Veo 3.1 dan MiniMax H3 bahkan dapat menghasilkan musik. BGM tetap dipasang secara terpisah, bukan karena keduanya tidak mampu membuatnya, melainkan karena dua alasan: (1) setiap shot hanya berdurasi beberapa hingga puluhan detik, dan ketika beberapa shot disambung, gaya musik, volume, serta melodi tidak berkesinambungan; (2) menyimpan dialog, suasana, efek, dan BGM pada trek terpisah memungkinkan BGM saja diganti kemudian atau dikecilkan hanya selama narasi. Di sinilah nilai BGM eksternal seperti milik arcalune berkaitan langsung dengan kebutuhan produksi.
Urutan praktis untuk memberi suara pada video bisu
Dalam praktik, pekerjaannya biasanya mengikuti urutan ini: buat shot → pilih shot yang akan digunakan → pasang satu BGM di sepanjang video → tambahkan suara suasana untuk setiap adegan (hujan, ombak, kebisingan ruangan, dan sebagainya) → sinkronkan foley dengan gerakan orang dan benda (langkah kaki, gesekan kain, benturan) → tempatkan efek pendek pada setiap transisi layar → kecilkan volume BGM hanya pada bagian yang memiliki narasi atau nyanyian. Kuncinya adalah memasang BGM lebih dahulu sebagai dasar, lalu menambahkan efek sebagai titik-titik khusus pada tahap akhir.
Untuk mengekspor audio bersama video di ComfyUI, siapkan input audio pada node Video Combine dari add-on VideoHelperSuite lalu hubungkan node yang memuat berkas musik (ini bukan node standar, jadi harus dipasang terlebih dahulu). Audio juga dapat dilapiskan kemudian dalam perangkat lunak penyunting video. Apa pun caranya, unduh trek di sini dan gunakan apa adanya.
Referensi
Pola yang digunakan untuk membuat video AI di YouTube
Video penjelasan dan dokumenter faceless dibuat dengan urutan naskah → suara sintetis → video atau gambar AI → subtitle, disertai BGM tipis yang tidak mengganggu suara. Film pendek sinematik dan trailer membuat shot dari storyboard dan gambar referensi, kemudian menyusunnya dengan musik latar, foley, serta benturan dan suara menanjak bergaya trailer (karya yang diputar di festival film AI adalah contoh utamanya). Shorts, meme, dan montase yang mengandalkan tempo melapiskan BGM cepat serta efek transisi atau benturan pada lelucon berdurasi 5 hingga 15 detik.
Video musik AI menetapkan lagu final lebih dahulu, menghasilkan banyak klip pendek untuk setiap birama, lalu menyuntingnya mengikuti ketukan—audio bawaan model generasi tidak digunakan dan lagu asli tetap menjadi audio utama. Iklan produk dan film merek membuat shot dengan gambar produk dan logo sebagai referensi, lalu menambahkan narasi, suara logo, dan BGM pendek. AI ASMR menghasilkan gambar dan suara untuk memotong, menghancurkan, atau menuang material yang tidak ada di dunia nyata, mengganti bagian yang terdengar janggal dengan suara material nyata, lalu menyuntingnya kembali menjadi format panjang. Video suasana dan pendamping kerja mengulang atau memperpanjang klip pendek serta memasang BGM panjang dan suara suasana secara terpisah. Bagian di bawah menunjukkan suara arcalune yang sesuai untuk setiap pola.
Film pendek sinematik, film AI, dan trailer
Shot dibuat dari storyboard dan gambar referensi, lalu disunting menjadi satu karya. Musik latar yang berkesinambungan dilapisi foley, benturan, dan suara menanjak bergaya trailer.
- 1
壮大でドラマティックな劇伴
Musik latar megah dan dramatis yang mengalun di sepanjang shot agar terasa seperti film atau trailer. Bahkan film pendek yang tersusun dari potongan berdurasi beberapa detik akan terasa sebagai satu karya utuh ketika satu musik mengiringinya dari awal hingga akhir.
Cocok untukFilm & pendek AI, Trailer, Pembuka
Suara ini dari arcalune
- 2
緊張と暗さの劇伴
Musik latar bernuansa gelap yang membangun kegelisahan dan ketegangan. Cocok untuk adegan menegangkan dalam film AI atau jeda sesaat sebelum pergantian shot dalam trailer.
Cocok untukSuspens, Bangun tegang trailer, Adegan menegangkan
Suara ini dari arcalune
- 3
予告編の一撃と上昇音
Satu bunyi benturan untuk menegaskan trailer dan suara yang menanjak untuk membangun antisipasi. Jika ditempatkan saat judul muncul atau shot berganti, keduanya membuat momen utama terasa lebih kuat.
Cocok untukKemunculan judul, Pergantian potongan, Aksen sorotan
Suara ini dari arcalune
- Dum 10:02
- Peluit Terbang Menjauh 10:03
- Naik Level 10:02
Video penjelasan, dokumenter, dan video faceless
Dibuat dengan urutan naskah, suara sintetis, video atau gambar AI, lalu subtitle. Suara menjadi unsur utama, sehingga BGM tipis dipasang tanpa menutupinya.
- 4
ナレーションを邪魔しないBGM
BGM tenang dengan sedikit elemen dan piano sebagai instrumen utama. Untuk video penjelasan dan dokumenter dengan narasi suara sintetis (video faceless), musik ini dapat dipasang di bawah tanpa menutupi suara.
Cocok untukPenjelasan & dok, Video faceless, Di bawah narasi
Suara ini dari arcalune
Video musik AI dan visualizer
Lagu final ditetapkan lebih dahulu, lalu banyak klip pendek dibuat untuk setiap birama dan disunting mengikuti ketukan. Lagu menjadi audio utama, sehingga yang ditambahkan adalah efek suara transisi.
- 5
曲に合わせる転換の効果音
Video musik AI sudah menggunakan lagu final sebagai audio utama, jadi yang ditambahkan adalah efek suara transisi, bukan BGM tambahan. Whoosh yang bersih dan satu hentakan untuk ditempatkan pada ketukan atau jeda lirik.
Cocok untukKetukan & jeda lirik, Transisi visual, Visualizer
Suara ini dari arcalune
- Whoosh! 10:03
- Peluit Terbang Menjauh 20:02
- Dum 20:02
Video suasana, pendamping kerja, dan latar berulang
Klip AI pendek diulang atau diperpanjang menjadi tayangan panjang. BGM yang cocok diputar lama dipadukan dengan suara lingkungan seperti hujan atau ombak.
- 6
長時間流すアンビエント
Musik ambient berdurasi lebih panjang dengan batas yang lembut. Untuk video pendamping kerja dan video suasana yang mengulang atau memperpanjang klip AI berdurasi beberapa detik menjadi tayangan panjang, musik ini menjadi dasar yang tidak cepat melelahkan saat diputar lama.
Cocok untukLatar panjang, Suasana, Latar loop
Suara ini dari arcalune
- 7
雨と波の環境音
Suara suasana hujan dan ombak. Saat dilapiskan pada video loop tanpa suara, keduanya menambahkan kesan berada di tempat itu yang tidak dapat disampaikan oleh gambar saja.
Cocok untukAdegan hujan & ombak, Footage loop, Dasar suasana
Shorts, meme, dan video bertempo cepat
Lelucon berdurasi 5 hingga 15 detik atau montase potongan yang disambung. Format ini kuat dengan BGM bertempo cepat yang dipadukan dengan efek suara untuk menegaskan transisi dan punchline.
- 8
テンポの良い短尺BGM
BGM cerah, ringan, dan terus bergerak maju. Mudah dipadukan dengan Shorts yang mengandalkan tempo, seperti lelucon berdurasi 5 hingga 15 detik atau montase potongan yang disambung.
Cocok untukShorts & vertikal, Montase, Potongan tempo
Suara ini dari arcalune
- 9
切り替えと衝撃の効果音
Suara flash untuk pergantian shot, satu benturan, dan whoosh yang bersih. Jika ditempatkan pada transisi atau punchline dalam video bertempo cepat atau meme, efek ini membuat ritme menonton terasa lebih rapat.
Cocok untukTransisi, Punchline & meme, Aksen impact
Suara ini dari arcalune
- POTONGAN KILAT 010:02
- Dum 30:02
- Whoosh! 30:03
AI ASMR dan video tekstur
Gambar dan suara dibuat untuk adegan memotong, menghancurkan, atau menuang material yang tidak ada di dunia nyata, lalu bagian yang terdengar janggal diganti dengan suara material nyata. Di sini efek suara menjadi unsur utama.
- 10
質感・フォーリーの効果音
Suara gunting memotong, air mengalir, dan kaca pecah. Dalam AI ASMR dan video yang menampilkan tekstur, gunakan suara ini untuk mengganti bagian ketika suara bawaan klip hasil generasi terdengar janggal dengan suara material yang jelas dan tegas. Ini adalah sebagian dari koleksi foley arcalune.
Cocok untukASMR AI, Aksen tekstur, Ganti suara material
Suara ini dari arcalune
- GUNTING 010:10
- KERAN 010:11
- Kaca Pecah 10:02
Sejauh apa pun visual video AI berkembang, pemilihan musik untuk setiap bagian dan efek yang menutup suatu momen tetap menjadi tahap yang ditentukan manusia. Pilih suara yang sesuai dengan video Anda dari bagian-bagian genre.
Halaman setiap trek menautkan musik dan efek lain dari kelompok yang sama. Jika membutuhkan durasi atau suasana berbeda, telusuri dari sana.
Tanya jawab
- Bukankah video AI juga menghasilkan audio? Apakah BGM tetap diperlukan?
Tergantung modelnya. Generasi standar Wan di ComfyUI, HunyuanVideo, Runway, Luma, dan Pika tidak menghasilkan suara, sehingga audio ditambahkan setelahnya. Veo 3.1, MiniMax H3, Kling 3, LTX-2.5, dan Seedance juga menghasilkan audio, termasuk musik. Namun, setiap shot hanya berdurasi beberapa hingga puluhan detik, dan dalam video akhir yang disambung, gaya musik serta volumenya tidak berkesinambungan. BGM yang mengalun sepanjang video biasanya dipasang secara terpisah pada penyuntingan akhir agar dapat diganti kemudian.
- Bagaimana cara menambahkan musik ke video bisu yang dibuat di ComfyUI?
Siapkan input audio pada node Video Combine dari add-on VideoHelperSuite dan hubungkan node yang memuat berkas musik, lalu ekspor keduanya bersama-sama (ini bukan node standar, jadi harus dipasang terlebih dahulu). Musik juga dapat dilapiskan kemudian dalam penyunting video. Unduh dan gunakan trek yang tersedia di sini.
- Apakah materi ini dapat digunakan dalam video yang dimonetisasi atau iklan?
Ya. Semua BGM dan efek suara arcalune dapat diunduh untuk penggunaan komersial tanpa wajib mencantumkan kredit. Perlu diperhatikan bahwa boleh atau tidaknya video hasil AI itu sendiri digunakan secara komersial bergantung pada ketentuan alat yang digunakan, jadi periksa sumber resmi setiap alat.
