Audionaut, aplikasi penyunting audio multitrack open-source untuk Windows, macOS, dan Linux, merilis fitur kontrol AI agent berbasis Model Context Protocol (MCP). Pendekatan ini memungkinkan AI agent memotong, menggeser, hingga menata ulang trek audio secara langsung pada proyek yang sedang terbuka, tanpa risiko merusak file kerja secara permanen.
Inovasi ini memberikan kendali penuh di tangan pengguna. Setiap perubahan dari AI hanya dihitung sebagai satu langkah undo tunggal, sementara interaksi manual dari manusia selalu mendapat prioritas utama jika terjadi konflik eksekusi.
Kontrol AI Agent Melalui Model Context Protocol
Audionaut menyediakan dukungan AI agent melalui arsitektur Model Context Protocol (MCP). Server MCP internal pada aplikasi ini mengekspos berbagai perintah command-line (CLI) sebagai alat (tools) yang dapat dipanggil oleh agent AI yang kompatibel.
Perangkat lunak ini tidak asal mengeksekusi. Berbagai instruksi pengolahan audio dapat diproses secara otomatis, mulai dari ekspor dan impor audio, analisis durasi klip, pemotongan klip (splitting), pemindahan posisi pada timeline, penyesuaian tingkat gain dan efek fade, hingga pengaturan kecepatan trek dan perakitan aransemen.
Alur kerja MCP pada Audionaut meneruskan perintah agent langsung ke dalam proyek yang sedang aktif dibuka di dalam aplikasi. Langkah ini mencegah file rusak. Perubahan yang dihasilkan AI dikerjakan berdasarkan kondisi proyek terkini di dalam memori, termasuk draf suntingan yang belum disimpan oleh pengguna. Setelah perintah selesai diproses, hasilnya akan dimasukkan ke dalam riwayat undo standar aplikasi. File proyek sendiri tidak langsung ditulis ke penyimpanan disk secara otomatis, sehingga pengguna memegang keputusan akhir kapan harus menyimpan proyek tersebut.
Perlindungan terhadap suntingan manusia juga dirancang sangat ketat. Jika pengguna melakukan perubahan manual pada timeline saat AI agent sedang memproses perintah, hasil pengerjaan agent akan otomatis dibatalkan (dropped). Sistem kemudian meminta agent untuk mengulang proses (retry) daripada menimpa suntingan terbaru buatan manusia. Selain itu, perintah agent akan ditolak saat aplikasi sedang berada dalam mode perekaman (recording), dan proses ekspor akan ditolak ketika audio sedang diputar (playback).
Pemisahan Trek Lokal Berbasis Model htdemucs
Selain integrasi AI agent, Audionaut juga memboyong fitur pemisahan trek (stem separation) yang berjalan secara lokal tanpa memerlukan koneksi ke server awan. Fungsi ini dimotori oleh model htdemucs besutan Meta AI Research yang dieksekusi melalui pustaka native `demucs.cpp`.
Semua proses berjalan di CPU lokal. Pengguna hanya perlu mengunduh file bobot model sebesar kira-kira 80 MB saat pertama kali mengaktifkan fitur ini. Ukuran unduhan awal sangat ringan. Setelah terunduh, proses pemisahan klip audio berformat mono maupun stereo dapat langsung dijalankan hingga durasi maksimal sepuluh menit per klip.
Model pemisah trek ini akan memecah satu klip audio menjadi empat trek terpisah, yaitu Drums, Bass, Other, dan Vocals. Pengintegrasian fitur ini ke dalam sistem Audionaut dirancang secara efisien, di mana seluruh proses pemisahan empat trek dianggap sebagai satu langkah pengeditan tunggal. Artinya, jika hasil pemisahan vokal tidak sesuai dengan ekspektasi, pengguna cukup menekan satu perintah undo untuk menghapus keempat trek baru tersebut secara bersamaan.
Evaluasi Alur Kerja dan Potensi Pengembangan
Aplikasi yang telah dikembangkan selama beberapa tahun ini mendapatkan perhatian dari komunitas pengembang setelah sang pembuat membagikan pembaruan proyek di forum Show HN pada 2 Oktober lalu. Meskipun bukan aplikasi yang benar-benar baru diluncurkan dari nol, penerapan batasan ketat pada perilaku AI agent menjadi daya tarik tersendiri.
Kontrol penuh tetap di tangan pengguna. Komunitas di forum Hacker News turut memberikan sejumlah masukan konstruktif untuk pengembangan Audionaut ke depan. Beberapa masukan utama meliputi penyempurnaan alur impor file agar lebih praktis, kehadiran fitur crossfade otomatis, kontrol kurva amplitudo (envelopes), hingga penambahan efek audio bawaan. Pengembang Audionaut mengonfirmasi bahwa sebagian besar masukan tersebut telah dimasukkan ke dalam daftar prioritas pengerjaan (backlog).
Secara teknis, hasil pemisahan trek maupun suntingan berbasis AI pada Audionaut masih memerlukan sentuhan penyesuaian manual dari pengguna. Namun, arsitektur yang mengintegrasikan perintah AI agent ke dalam sistem undo native serta kemampuan pemrosesan stem separation berbasis CPU lokal menjadikan Audionaut sebagai opsi editor audio open-source yang menarik untuk diuji pada sistem Windows, macOS, maupun Linux.