Τοπικό voice control σε Raspberry Pi Pico 2 W με τρία AI μοντέλα
Τι περιλαμβάνει το pipeline
Το voice interface χωρίζεται σε τρία διακριτά μέρη. Το πρώτο είναι το voice activity detection, το οποίο αναλαμβάνει να εντοπίσει πότε ο χρήστης μιλάει. Το δεύτερο είναι το SpellingCNN speech-to-text, ένα νευρωνικό δίκτυο που μετατρέπει την ομιλία σε κείμενο και υποστηρίζει έως 50 tokens. Το τρίτο είναι ένα neural text-to-speech (TTS) που παράγει φωνητική απάντηση. Η ροή εκτέλεσης είναι κυκλική: εντοπισμός φωνητικής δραστηριότητας, ακρόαση για tokens-εντολές, επεξεργασία τους σε C++, απάντηση μέσω TTS, και επανάληψη.
Ένα ιδιαίτερα χρήσιμο χαρακτηριστικό είναι ότι το speech-to-text μπορεί να επανεκπαιδευτεί για να αναγνωρίζει οποιεσδήποτε συγκεκριμένες λέξεις επιθυμεί ο κατασκευαστής. Αυτό ανοίγει τον δρόμο για εξειδικευμένες φωνητικές εντολές σε DIY projects.
Στοίχημα με τη μνήμη
Το κόστος σε πόρους είναι αισθητό: τα τρία μοντέλα καταλαμβάνουν 3.6 MiB από τα διαθέσιμα 4 MiB FLASH, καθώς και 468 KiB από τη SRAM ενός stock Pi Pico 2 board. Αυτό αφήνει ελάχιστο χώρο για επιπλέον λογισμικό, καθιστώντας δύσκολη την ενσωμάτωση οποιασδήποτε ουσιαστικής εφαρμογής δίπλα στο toolkit. Παρ' όλα αυτά, το γεγονός ότι τρία ξεχωριστά AI μοντέλα χωράνε σε τόσο περιορισμένο υλικό παραμένει αξιοσημείωτο τεχνικό επίτευγμα.
Πηγές
Voice Control Toolkit Comes To A Pico Near You — Hackaday
176
