Cos'è il computer use nell'AI?
La capacità di un agente AI di vedere lo schermo e usare mouse e tastiera come una persona, senza bisogno di API dedicate.
Il computer use è la capacità di un agente AI di operare un computer nello stesso modo in cui lo farebbe una persona: guarda lo schermo tramite screenshot, interpreta cosa mostra e agisce muovendo il cursore, cliccando, scrivendo con la tastiera, invece di dialogare con l'applicazione tramite un'interfaccia di programmazione dedicata. Anthropic ha introdotto questa modalità con lo strumento computer use di Claude, in anteprima di ricerca su macOS da marzo 2026. Alternative già disponibili esistono: OpenAI espone via API un modello di computer-using agent, e Google offre Gemini Computer Use, dopo aver chiuso il progetto Project Mariner assorbendone le capacità. La differenza rispetto a un agente che chiama direttamente le API di un servizio è netta: il computer use non richiede alcuna integrazione dedicata e funziona su qualunque applicazione che una persona saprebbe usare, ma è più lento e meno affidabile, perché ogni azione dipende dall'interpretazione corretta di un'immagine, non da una chiamata strutturata con una risposta prevedibile.
Screenshot, non chiamate strutturate
Il meccanismo è un ciclo: il modello riceve uno screenshot dello schermo, ragiona su cosa mostra e restituisce un'azione, muovi il cursore in queste coordinate, clicca, digita questo testo, premi questo tasto. Il programma che ospita il modello esegue davvero l'azione sul sistema operativo o sul browser e scatta un nuovo screenshot, che diventa l'input del passo successivo. Non c'è alcuna struttura dati condivisa tra modello e applicazione, come accade invece nel tool calling classico: il modello lavora sulla stessa rappresentazione visiva che vedrebbe un utente umano, con il vantaggio dell'universalità e lo svantaggio della fragilità che ne derivano.
Quando ha senso rispetto all'integrazione via API
Un'API resta la scelta più affidabile quando esiste: risposte strutturate, prevedibili, verificabili prima di agire. Il computer use guadagna terreno proprio dove l'API non esiste o non è raggiungibile: applicazioni desktop legacy, terminali di sistemi gestionali storici, software di un fornitore che non espone integrazioni programmatiche. Un caso concreto è un'azienda che deve automatizzare l'inserimento dati in un'interfaccia di un sistema AS/400 ancora attivo in produzione, senza margine per riscriverla nel breve periodo: un agente con computer use può leggere un documento in ingresso e compilare la maschera a schermo come farebbe un operatore, mentre l'azienda pianifica la modernizzazione vera e propria su un orizzonte più lungo.
Il rischio che porta con sé
Dare a un agente il controllo dello schermo, del mouse e della tastiera significa concedergli lo stesso raggio d'azione di un utente umano loggato, molto più ampio del set minimo di operazioni che un'integrazione API ben progettata concederebbe. Questo apre alla stessa famiglia di rischi già nota per gli agentic browser: un elemento malevolo mostrato a schermo, un popup, un testo nascosto in un documento aperto, può essere interpretato dal modello come un'istruzione da eseguire. Va quindi trattato come un problema di permessi e di automazione di processo ad ambito ristretto, con conferma umana sulle azioni irreversibili, non come un tool di produttività a rischio zero.
Perché conta per chi decide
Il computer use non sostituisce l'integrazione via API dove questa è disponibile: resta l'ultima risorsa, non la prima scelta, perché è meno affidabile e richiede più supervisione. Vale l'investimento quando il costo di riscrivere o integrare un sistema legacy supera di gran lunga quello di operarlo tramite un'interfaccia grafica sorvegliata, con permessi minimi e un ambito di azione ben definito fin dal primo giorno.
Domande frequenti
Termini correlati
- Agentic Browser (Browser Agentico) · Browser con un agente AI che naviga, clicca e agisce al posto tuo: apre un vettore di prompt injection critico, con accesso a sessioni e credenziali reali.
- Tool calling (function calling) · Il meccanismo con cui un LLM richiede l'esecuzione di una funzione esterna invece di rispondere solo a parole: la base di ogni agente.
- Agenti AI (Agentic AI) · Sistemi AI che non si limitano a rispondere: pianificano, usano strumenti ed eseguono azioni in autonomia dentro i tuoi processi.
- Intelligent Process Automation (IPA) · Automazione che unisce RPA e AI per gestire documenti e processi non strutturati, non solo passaggi meccanici su interfacce esistenti.
- Generative UI · L'interfaccia composta a runtime da un modello, non predisposta in anticipo: diversa da personalizzazione e UI adattiva.
Un termine che ti riguarda da vicino? Parliamone.
CONTATTAMI