Non è sfruttando Fable di Anthropic che Kimi K3 ha raggiunto tale bravura, secondo gli esperti.
Accuse dagli USA: Moonshot Avrebbe Copiato Modelli AI e Usato Chip Proibiti
Il settore dell’intelligenza artificiale è in fermento a seguito delle gravi accuse mosse da Michael Kratsios, consigliere scientifico della Casa Bianca. Kratsios ha dichiarato che Moonshot, l’azienda cinese dietro Kimi K3, il più grande LLM open-weight disponibile, avrebbe costruito il suo modello copiando l’LLM Fable di Anthropic e utilizzando chip non autorizzati per l’esportazione in Cina.
"La distillazione industriale su larga scala e segreta, volta a rubare tecnologia proprietaria statunitense e a minare la ricerca americana, è inaccettabile", ha scritto Kratsios. Le sue parole giungono in un momento di discussioni sull’opportunità di vietare i modelli open-weight cinesi, che stanno scuotendo l’industria dell’AI. Moonshot non ha risposto alle domande sul suo processo di training, e Kratsios non ha fornito ulteriori dettagli sulle fonti delle sue accuse. Le dichiarazioni di Kratsios fanno eco a commenti simili del Segretario al Tesoro Scott Bessent, il quale aveva affermato di riscontrare "watermark dei nostri modelli linguistici di grandi dimensioni statunitensi su molti modelli cinesi, e questo è inaccettabile". Non è chiaro in cosa consistano tali watermark, e il Dipartimento del Tesoro non ha risposto a una richiesta di chiarimento.
Tuttavia, gli esperti sono scettici sul fatto che la distillazione – il processo di interrogare un LLM per determinarne il funzionamento interno e copiarne le capacità – sia la sola responsabile delle avanzate capacità dimostrate da Kimi K3. "Non credo che si ottenga un modello così forte e così rapidamente sulla scia di Fable facendo solo distillazione", ha dichiarato a TechCrunch Braden Hancock, ricercatore presso il Laude Institute e co-fondatore di Snorkel AI. "Non c’è nemmeno francamente tempo, giusto? Fable è disponibile pubblicamente solo dal 1° luglio. Non si possono distillare così tanti dati, addestrare un modello e rilasciarlo in due settimane."
Nathan Lambert, ricercatore di AI presso l’Allen Institute for AI, ha osservato in un podcast che "la distillazione sta diventando sempre meno efficace man mano che i modelli cinesi si avvicinano alla frontiera e il regime di addestramento si sposta verso l’apprendimento per rinforzo". Ha aggiunto: "se così fosse, tutti sarebbero facilmente in grado di raggiungere un GLM o un K3 usando i suoi dati per la distillazione. Ma non lo abbiamo visto, o non lo vedremo, solo con il fine-tuning supervisionato." La distillazione richiede a un laboratorio di interrogare sistematicamente il modello target per generare dati utili per il post-training, talvolta chiedendo al modello di esplicitare la sua "catena di pensiero". Altre volte, prompt e risposte vengono usati per addestrare un nuovo modello attraverso il fine-tuning supervisionato (SFT). È questo processo di fine-tuning che può far sì che un modello apparentemente creato da terzi si autodefinisca "Claude". Tuttavia, secondo Lambert, i benefici dell’SFT stanno diminuendo con la crescente complessità dei modelli. Distillare capacità simili a quelle di Fable richiederebbe probabilmente tecniche di apprendimento per rinforzo, che implicano che un agente del modello più grande valuti le risposte del modello più piccolo e si adegui di conseguenza. Queste tecniche avanzate richiedono infrastrutture più significative e carichi di lavoro intensivi, rendendo costoso e lento l’utilizzo delle API di un laboratorio di frontiera.
Sembra probabile che modelli di frontiera precedenti abbiano contribuito a Kimi; Anthropic aveva già accusato pubblicamente Moonshot, DeepSeek e MiniMax di distillare sistematicamente i suoi modelli all’inizio dell’anno, scoprendo milioni di scambi tra i suoi modelli e utenti identificati presso quelle aziende tramite indirizzi IP e altri metadati, definiti come "distinti dai normali schemi di utilizzo, riflettendo un’estrazione deliberata di capacità piuttosto che un uso legittimo". Anthropic non ha risposto alle domande di TechCrunch sulla distillazione di Fable. La distillazione, tuttavia, è considerata una pratica comune tra le aziende di AI, non solo in Cina. Elon Musk ha testimoniato all’inizio dell’anno che la sua azienda SpaceXAI ha distillato modelli OpenAI per sviluppare Grok, e che tale pratica era diffusa nel settore. Il confine tra distillazione e sviluppo di set di dati sintetici, ad esempio, può essere piuttosto sfumato. "In generale, gli americani sottovalutano la competenza tecnica di questi team cinesi", ha detto Hancock. "Uno dei fondatori di Moonshot era uno studente di dottorato alla CMU. Sono ricercatori e ingegneri legittimi che fanno un lavoro solido… Se i modelli americani si fermassero, credo che il progresso della Cina rallenterebbe, ma continuerebbe. Non stanno solo sfruttando il lavoro altrui."
È anche difficile separare la distillazione dalla seconda parte del commento di Kratsios, secondo cui Moonshot avrebbe ottenuto chip Nvidia avanzati, i Grace Blackwell 300s, e avrebbe anche avuto accesso a server dotati di GB300 in Thailandia. Questi chip sono banditi dall’esportazione in Cina, ma esiste un mercato nero, secondo Sam Bresnick, ricercatore presso il Center for Security and Emerging Technology di Georgetown. A maggio, il fondatore di Supermicro, un produttore di server statunitense, è stato incriminato per contrabbando di chip avanzati in Cina. "Sono un sostenitore delle leggi ‘conosci il tuo cliente’ per i data center in tutto il mondo", ha detto Bresnick. "Se si consente a un’azienda di condurre enormi cicli di addestramento sul proprio hardware all’avanguardia, è necessario un meccanismo di segnalazione per sapere chi è l’azienda e cosa sta facendo." Il Dipartimento del Commercio del Presidente Joe Biden aveva proposto regole federali "conosci il tuo cliente" per i data center nel 2024, ma non sono stati fatti ulteriori progressi sotto Donald Trump. Gli esportatori che spediscono chip avanzati all’estero, tuttavia, sono tenuti a garantire che vengano utilizzati solo per scopi approvati.
