Meet RedPajama, a project for open source LLMs | Photoshop Beta ai Free Download | Dall - e Free Alternative | Starryai | Turtles AI

Meet RedPajama, a project for open source LLMs
DukeRem23 aprile 2023
  Modelli di fondazione come il #GPT-4 hanno rivoluzionato il panorama dell’#AI. Tuttavia, la maggior parte di questi strumenti all’avanguardia sono confinati all’interno di modelli commerciali o sono solo parzialmente aperti. Oggi siamo entusiasti di annunciare un’iniziativa innovativa per colmare questa lacuna: #RedPajama, un progetto volto a creare una suite di modelli completamente open-source. La prima pietra miliare del progetto - la riproduzione del dataset di addestramento di #LLaMA contenente oltre 1,2 trilioni di #token - è stata completata con successo. Poiché le #API commerciali continuano a limitare la ricerca, la personalizzazione e l’uso di dati sensibili, la comunità dell’IA sta assistendo a uno spostamento verso progetti open-source. Questo movimento, che ricorda l’impatto di Linux nel mondo del software, ha aperto la strada a modelli semi-aperti come LLaMA, #Alpaca, #Vicuna e #Koala, nonché a modelli completamente aperti come Pythia, OpenChatKit, Open Assistant e Dolly. RedPajama aspira a consolidare il movimento open-source e a promuovere l’innovazione offrendo un modello linguistico leader e completamente open-source. Insieme, Ontocord.ai, ETH DS3Lab, Stanford CRFM, Hazy Research e MILA Québec AI Institute stanno collaborando a questo ambizioso progetto. RedPajama comprende tre componenti chiave: Dati di pre-addestramento di alta qualità con un’ampia copertura Modelli di base addestrati in scala su questi dati Istruzioni per la messa a punto dei dati e dei modelli per migliorare l’usabilità e la sicurezza. Questo annuncio segna il rilascio del primo componente, i dati di pre-formazione. Il punto di partenza di RedPajama è LLaMA, che vanta un vasto set di dati di 1,2 trilioni di token e un modello di 7 miliardi di parametri in grado di funzionare su un’ampia gamma di GPU. Tuttavia, LLaMA e i suoi derivati sono limitati a scopi di ricerca non commerciali. L’obiettivo di RedPajama è creare una riproduzione completamente open-source di LLaMA, aprendo le porte ad applicazioni commerciali e a pipeline di ricerca trasparenti. Il set di dati di base di RedPajama è ora disponibile per il download tramite Hugging Face. Composto da ~5TB decompresso su disco e ~3TB compresso, il dataset comprende sette fette di dati: CommonCrawl, C4, GitHub, arXiv, Books, Wikipedia e StackExchange. Ogni fetta è sottoposta a una meticolosa pre-elaborazione e filtraggio, con filtri di qualità disponibili su GitHub. Questa trasparenza permette a chiunque di riprodurre RedPajama-Data-1T. In collaborazione con il progetto Meerkat, sono stati rilasciati una dashboard e un embedding Meerkat per esplorare il sottoinsieme GitHub del corpus. La dashboard è disponibile per l’installazione e l’uso diretto su GitHub. In prospettiva, i prossimi passi di RedPajama prevedono la formazione di un modello di base robusto e la messa a punto delle istruzioni. Il programma INCITE, sostenuto dall’Oak Ridge Leadership Computing Facility (OLCF), contribuirà all’addestramento di una serie completa di modelli, il cui primo set sarà rilasciato nelle prossime settimane. Utilizzando le centinaia di migliaia di istruzioni naturali di alta qualità di OpenChatKit, saranno rese disponibili versioni ottimizzate per le istruzioni dei modelli RedPajama, sbloccandone l’immenso potenziale. Tradotto con www.DeepL.com/Translator (versione gratuita)