OmniParser V2: nuova tecnologia per l’automazione intelligente delle interfacce grafiche | Llm informatica | Chat gpt gratis | Chatgpt test | Turtles AI

OmniParser V2: nuova tecnologia per l’automazione intelligente delle interfacce grafiche
Un sistema avanzato che migliora l’interazione degli LLM con le GUI, aumentando precisione e velocità nell’identificazione degli elementi interattivi
Editorial Team16 febbraio 2025

 


OmniParser V2 rivoluziona l’automazione della GUI trasformando gli LLM in agenti avanzati di interazione con lo schermo. Convertendo gli screenshot in elementi strutturati, migliora la comprensione della semantica visiva e la precisione delle azioni. Offre latenza ridotta del 60% rispetto alla versione precedente e supporta diversi modelli di AI.

Punti chiave:

  • Automazione avanzata: OmniParser V2 migliora la capacità degli LLM di interagire con le GUI.
  • Maggiore precisione: Identifica elementi interattivi con più accuratezza rispetto alla versione precedente.
  • Inferenza più veloce: Ottimizzazione delle didascalie riduce la latenza del 60%.
  • Sicurezza e mitigazione: Applicazione di principi di Responsible AI per ridurre i rischi.

OmniParser V2 rappresenta un’evoluzione importante nell’automazione delle interfacce grafiche, colmando il divario tra la capacità di comprensione dei modelli LLM e la complessità degli ambienti visivi digitali. Il principale ostacolo nell’impiego degli LLM per l’interazione con le GUI è la capacità di individuare e interpretare correttamente gli elementi presenti su uno schermo, in particolare icone e componenti interattivi. OmniParser V2 affronta questa sfida trasformando gli screenshot da semplici rappresentazioni pixelate in una struttura leggibile e interpretabile dagli LLM, consentendo loro di prevedere e selezionare l’azione corretta in base ai dati estratti. La nuova versione introduce miglioramenti significativi rispetto alla precedente, aumentando l’accuratezza nel rilevamento di elementi più piccoli e riducendo i tempi di elaborazione. Questo è reso possibile grazie a un set di dati di addestramento più ampio, comprendente informazioni avanzate sulle icone e i loro ruoli funzionali. Inoltre, la riduzione della dimensione del modello di didascalia delle icone contribuisce a un abbattimento del 60% della latenza operativa, permettendo una risposta più rapida ed efficiente. In particolare, combinato con GPT-4o, OmniParser V2 raggiunge un’accuratezza media di 39,6 nel benchmark ScreenSpot Pro, un risultato di gran lunga superiore rispetto al punteggio originario di GPT-4o, pari a 0,8. Per facilitare l’integrazione e la sperimentazione con diverse configurazioni di agenti, è stato sviluppato OmniTool, un ambiente containerizzato per Windows basato su Docker. Questo sistema include una gamma di strumenti pensati per l’interazione con le GUI, supportando modelli di AI all’avanguardia come OpenAI (4o/o1/o3-mini), DeepSeek (R1), Qwen (2.5VL) e Anthropic (Sonnet). Attraverso OmniTool, le fasi di comprensione dello schermo, individuazione degli elementi, pianificazione dell’azione ed esecuzione sono ottimizzate e rese più accessibili. La sicurezza e la mitigazione dei rischi sono aspetti fondamentali del progetto. Per allinearsi ai principi di AI responsabile di Microsoft, il modello di didascalia delle icone è stato addestrato con dati mirati a prevenire deduzioni di attributi sensibili relativi agli individui. Inoltre, vengono fornite linee guida di sicurezza e strumenti di analisi delle minacce, tra cui il Microsoft Threat Modeling Tool, per garantire un utilizzo consapevole e controllato della tecnologia.

OmniParser V2 segna dunque un passo avanti nell’integrazione degli LLM come strumenti di automazione visiva, offrendo soluzioni avanzate per la gestione delle interfacce utente e riducendo le barriere tra AI e interazione grafica.

Video