( caso studio /17 )R&D · AI

Jarvisassistente vocale offline

Quanto può fare un assistente vocale che gira interamente su un PC consumer, senza mandare un solo byte in cloud? Il nostro banco di prova sull'AI locale.

+ASSISTENTE VOCALE 100% OFFLINE
Jarvis
100%offline, zero cloud
2modalità: agente e vision
1GPU consumer basta
/01

La domanda di ricerca

Gli assistenti vocali commerciali mandano tutto in cloud. Ma per molti usi — aziende con dati sensibili, contesti senza connettività, semplice principio di privacy — serve il contrario: un assistente che vive interamente sulla macchina. Jarvis esplora quanto si può ottenere oggi con hardware consumer.

/02

Come funziona

Microfono→Whisper (STT)→Qwen 2.5 su Ollama→Strumenti / Azioni→Piper (TTS)

Jarvis ascolta in italiano, trascrive in locale con faster-whisper, ragiona con Qwen 2.5 (7B) su Ollama e risponde con voce sintetizzata da Piper. Non è un chatbot: usa strumenti reali — legge e scrive file, cerca sul web, esegue comandi. La modalità vision aggiunge gli occhi: Qwen 2.5-VL osserva lo screenshot dello schermo e agisce con mouse e tastiera.

Le azioni pericolose richiedono conferma vocale obbligatoria, e un fail-safe interrompe tutto in emergenza. Tutto gira su una singola GPU consumer.

/03

Cosa abbiamo imparato

I modelli 7B locali sono già utilizzabili per l'automazione vocale quotidiana; il limite attuale è la precisione dei click su interfacce complesse — documentato onestamente, non nascosto. È esattamente il tipo di conoscenza che confluisce nei progetti clienti: sapere dove l'AI locale funziona (e dove non ancora) è ciò che distingue una consulenza seria da una demo.

/ST

Scheda tecnica

faster-whisper (STT)Ollama · Qwen 2.5 7BQwen 2.5-VL (vision)Piper TTSpyautogui + mss