Το LALAL.AI Voice Cloner είναι το νέο web-based εργαλείο της εταιρείας που σου επιτρέπει να ηχογραφήσεις τη δική σου φωνή και να τη «χτίσεις» πάνω σε οποιοδήποτε vocal audio file. Αν αναρωτιόσουν πότε η σειρά σου να τραγουδήσεις πάνω σε ξένο υλικό, η απάντηση είναι τώρα.
Η ιδέα πίσω από το εργαλείο θυμίζει τα AI voice changer algorithms που έχουν αρχίσει να εμφανίζονται συχνά τελευταία, μόνο που εδώ το workflow γυρίζει προς τον χρήστη: αντί να μετατρέπεις μια υπάρχουσα φωνή σε κάποιον άλλο χαρακτήρα, δημιουργείς ένα voice pack από τη δική σου φωνή και το χρησιμοποιείς ως βάση για επεξεργασία.
Πώς λειτουργεί το Voice Cloner
Το LALAL.AI ήταν ήδη γνωστό από το Voice Changer technology που είχε παρουσιαστεί πέρυσι. Εκεί, ανέβαζες ένα αρχείο και ο αλγόριθμος άλλαζε την αρχική φωνή σε target voice, πειράζοντας pitch, tone, timbre και άλλα χαρακτηριστικά. Στο αρχικό παράδειγμα της εταιρείας είχαν χρησιμοποιηθεί οι Beatles σε Eminem, αλλά και bespoke acapellas για bootleg χρήση.
Με το νέο Voice Cloner, η δυνατότητα επεκτείνεται ώστε να μπορείς να καταγράψεις τη δική σου φωνή — ή οποιαδήποτε φωνή έχεις πρόσβαση σε αυτήν — και να τη χρησιμοποιήσεις ως voice pack δίπλα στα διαθέσιμα packs της πλατφόρμας. Στο site αναφέρονται εφαρμογές όπως song covers, ad reads και video voiceovers.
Για να δημιουργηθεί το voice pack, το LALAL.AI ζητά καθαρό voice audio χωρίς μουσική ή θόρυβο, σε υψηλής ποιότητας format, διάρκειας από 10 έως 50 λεπτά. Αν δεν έχεις έτοιμο υλικό, μπορείς να ηχογραφήσεις τον εαυτό σου να διαβάζει ένα κείμενο ή ένα βιβλίο. Για καθάρισμα πριν από την ανάλυση, μπορεί να χρησιμοποιηθεί ένα πρόγραμμα όπως το iZotope RX ή το δικό του Voice Cleaner.
Αφού ανεβάσεις το αρχείο, η πλατφόρμα το επεξεργάζεται και δημιουργεί το pack, το οποίο στη συνέχεια μπορεί να χρησιμοποιηθεί στο Voice Changer module. Η διαδικασία δεν είναι άμεση· στο παράδειγμα του άρθρου χρειάστηκαν περίπου 15 λεπτά για να δημιουργηθεί το voice pack από περίπου 12 λεπτά audio.
Από film dialogue σε δικό σου vocal
Για δοκιμή, η διαδικασία εφαρμόστηκε πρώτα σε spoken audio, πάνω στη γνωστή σκηνή του 106 miles to Chicago από το The Blues Brothers. Το αρχείο είχε ληφθεί από YouTube και, για καθαρότερο αποτέλεσμα, πέρασε από το Voice Cleaner ώστε να απομονωθεί η φωνή από το background noise στο αρχικό .wav.
Στο Voice Changer επιλέχθηκε το προσωπικό voice pack και υπάρχουν ρυθμίσεις επεξεργασίας για accent και tonality, με επιλογές για source και target voice intonation. Υπάρχει επίσης κουμπί De-echo για μεγαλύτερη καθαρότητα, ενώ πριν την τελική επεξεργασία μπορείς να ακούσεις preview.
Το αποτέλεσμα έδειξε πώς η φωνή του χρήστη μπορεί να αντικαταστήσει μια ήδη ηχογραφημένη dialogue performance, σε ένα workflow που θυμίζει περισσότερο creative audio manipulation παρά απλό voice filtering.
Πάνω σε acapella και μέσα στο Ableton Live
Στη δεύτερη δοκιμή χρησιμοποιήθηκε ένα female acapella sample από το pack Soul Voices των Touch Loops. Και εδώ το αρχείο ανέβηκε με τον ίδιο τρόπο, με το ειδικά δημιουργημένο voice pack να «απλώνεται» πάνω στα vocals.
Μόλις το αποτέλεσμα κρίθηκε έτοιμο, το αρχείο κατέβηκε ως .wav και μπήκε απευθείας σε project στο Ableton Live, μαζί με Splice samples από τα Detroit House και Phase Plant Speed Garage. Από εκεί και πέρα χρησιμοποιήθηκε όπως κάθε άλλο audio clip σε production workflow.
Η λογική είναι ξεκάθαρη: αν έχεις ένα καθαρό voice pack, μπορείς να το περάσεις τόσο πάνω σε spoken material όσο και σε singing vocals, και μετά να το εντάξεις σε κανονική παραγωγή χωρίς να αλλάζεις τον τρόπο που δουλεύεις μέσα στο DAW.
Τι μένει από το Voice Cloner
Όταν είχε παρουσιαστεί πέρυσι το LALAL.AI Voice Changer, η σύγκριση με το sampling ήταν αναπόφευκτη. Με το Voice Cloner, αυτή η σχέση γίνεται ακόμη πιο άμεση, αφού η επεξεργασία της φωνής λειτουργεί σχεδόν σαν sampling 2.0. Όπως συμβαίνει και με το sample-based workflow, υπάρχουν και εδώ πιθανά νομικά ζητήματα, ιδιαίτερα σε περιπτώσεις copyright infringement. Το να δουλεύεις με τη δική σου φωνή είναι προφανώς λιγότερο ριψοκίνδυνο από το να χρησιμοποιείς φωνή κάποιου διάσημου προσώπου, αλλά αυτό δεν σημαίνει ότι δεν μπορεί να υπάρξουν θέματα, για παράδειγμα σε ένα cover που χρησιμοποιεί το original audio μιας Lady Gaga απλώς με αλλαγή φωνής.
Σε πρακτικό επίπεδο, το LALAL.AI Voice Cloner είναι εύχρηστο και αρκετά άμεσο, με την ποιότητα του voice pack να εξαρτάται σε μεγάλο βαθμό από το recording chain. Ένα καλό μικρόφωνο βοηθάει, αλλά ακόμα και ένα βασικό consumer-grade USB mic μπορεί να σταθεί αν το ζητούμενο είναι sample fodder για DJ sets και underground tracks.
Το LALAL.AI Voice Cloner διατίθεται σε δύο τιμές: το Vox Lite Bundle στα €20 για ένα voice pack και 20 minutes file time, και το Vox Max Bundle στα €45 για ένα voice pack και 500 minutes.
Περισσότερα στο LALAL.AI.
