Perchè il video di Matteo Flora su Google Gemini non corrisponde a verità
Il debunking di Flora punto per punto
Perchè il video di Matteo Flora su Gemini non corrisponde a verità — la nuova I.A. di Google DeepMind
Benvenuti/e! Essendo questo il nostro primo post, vogliamo presentarci: questo blog nascere per combattere la disinformazione scientifica & simila nel campo del machine-learning e dell’I.A.
Nasce per volontà di una piccola community di ricercatori in ambito open-source, stanchi della tifoseria da stadio e senza alcuno scopo di lucro, nonché dopo un lungo dibattito inter nos sulla necessità o meno di ribattere, e sulla volontà finalmente di far sentire la propria voce da insider e non da semplici influencer.
Proprio per questo, abbiamo deciso di adottare un format tanto originale quanto efficace: scriveremo solo su segnalazione. Sarà il pubblico a segnalare ciò su cui dovrebbero essere svolte delle verifiche. Questo ci permetterà di non perderci nel mare del rumore e rispondere a ciò che più conta — disincentivando il clickbait & simila.
Segnala il tuo caso all’e-mail TecnicIAmo@Gmail.Com, indicando se desideri o meno l’anonimato. Se nessuna indicazione è presente, tratteremo la tua segnalazione in forma anonima.
— — — — — — — — —
Segnalazione in forma pubblica, da Drew Hawkswood
Verifica presa in carico da: Marco Pinnisi
— — — — — — — — —

Si analizzi il video punto per punto:
0:00–0:45: “Come molti di voi, ho passato probabilmente un’oretta a guardare Gemini. Il nuovo Large Language Model di Google. È meraviglioso, sono rimasto con gli occhi sgranati e la bocca spalancata — prima di capire una cosa: che praticamente tutto quello che è stato comunicato nelle parti di PR, nei comunicati stampa, e addirittura nel video, è falso. È falso al limite se vogliamo essere gentili, della pubblicità ingannevole. Se non vogliamo essere gentili, beh, a livello di reato. Lo vediamo assieme, passo a passo, con tutta la documentazione perché io sono incazzato come una bestia, ma dovreste esserlo anche voi”
— — — — — — — — —
Il report tecnico di Gemini, intitolato “Gemini: A Family of Highly Capable Multimodal Models“ consta di 62 pagine.
È nostra opinione che:
Considerata l’ampiezza del report, pur escludendo reference e crediti d’autore, è impossibile leggerne, e tantomeno leggerne ed assorbirne, il contenuto in “un’oretta”.
Inoltre,
I video presenti sulla pagina https://deepmind.google/technologies/gemini/ occupano circa 33 minuti (ammettendo non ci siano pause tra un video e l’altro). Aggiungendo il testo si arriva già, o almeno ci si avvicina molto, all’oretta. Questo significa che Matteo Flora, al momento del video, non poteva avere letto il technical report e ammesso l’abbia fatto, non sarebbe potuto andare oltre le prime pagine. Questo specialmente considerando che:
Abbiamo reperito il curriculum di Matteo Flora sull’homepage del suo sito ufficiale, MatteoFlora.Com, e non abbiamo trovato alcuna indicazione di un background tecnico adeguato a comprendere il funzionamento de gli LLM o un report tecnico su di essi. Con questo non vogliamo dire che non esista, ma che noi non ne abbiamo trovato traccia.
Anche nell’ipotesi di ignorare qualsiasi altro contenuto ed iniziare a conoscere Gemini attraverso il technical report, un’oretta (ammesso il tempo fosse bastato per una lettura) non sarebbe stata sufficiente per assorbire i contenuti del report perché ciò implicherebbe, da parte di un outsider, una buona comprensione alla prima lettura di ciò che è un report tecnico.
Più avanti nel video, Matteo Flora dirà (6:30–6:41): “come l’ho beccato io in 5 minuti guardando su Twitter non era così difficile, beccarlo”.
Insomma, Flora sembra sempre essere molto “sbrigativo”.

— — — — — — — — —
1:20–1:24: “Il GPT-4 del mondo di Google”
Si rileva che:
Questa frase non sta in piedi in alcun modo, poiché:
Non abbiamo dati né sull’architettura di GPT-4, né sull’architettura di Gemini. Ciò che sappiamo è che, probabilmente, GPT-4 è un modello dense, con sparsità derivante da particolare architettura MoE (Mixture of Experts) — mentre Gemini sembra essere un singolo modello dense, nativamente multimodale (al contrario di ciò che sembra essere per GPT-4).
Differenze a parte, si segnala che:
La scelta di Google è tecnicamente molto più audace. Infatti, a fronte di benefici (per esempio, il facile *interleaving — con gioia degli utenti) portati dalla multimodalità nativa, Google si misura con sfide come quella del catastrophic forgetting*. Storicamente, nel campo dei modelli linguistici, i modelli universali sono sempre stati indietro rispetto ai modelli specializzati (quando messi a confronto sullo stesso ambito di expert*ise). Gemini è la prima eccezione.**
*Grazie all’interleaving, gli utenti potranno usufruire di nuovi casi d’uso (come l’aggiornamento dei grafici, il miglior apprendimento delle lingue… Di cui Google porta un esempio nei suoi video).
— — — — — — Ragion per cui, non possiamo che segnalare l’assurdità di un’affermazione come in 0:45–0:54 (“Si capisce che Google è davvero in ambasce per non essere riuscito minimamente a partecipare alla lotta dell’intelligenza artificiale”) poiché è un’opinione personale non supportata da alcunché. Ovviamente, presumiamo Matteo Flora si riferisca al mondo LLM e non all’intelligenza artificiale in senso ampio.
— — — — — — — — —
1:29–1:35
“Dei risultati eccezionali, battendo praticamente qualsiasi risultato di GPT”
Questa frase non solo non corrisponde al vero, ma non è coerente col resto del video. Si noti che:
Solo in 30 di 32 inizialmente disponibili, Gemini ottiene un punteggio migliore di GPT-4.
— — — — — — — — —
1:40–1:43
“Di base — 3 versioni. Una versione…”
Questa affermazione non corrisponde al vero poiché le versioni sono 4. Ciò rimarca come Matteo Flora non abbia letto, o comunque non abbia assorbito, i contenuti del report tecnico — visto che è indicato chiaramente, e per la precisione a partire da pagina 8 e pagina 9, che le versioni siano quattro. Questo errore viene ripetuto più volte nel video.

— — — — — — — — —
2:13–2:31
“Il problema è come, è stato annunciato. In un modo che vi assicuro dovrebbe far di sicuro vergognare come dei ladri chiunque c’ha lavorato e dovrebbe far vergognare soprattutto chiunque si occupa della comunicazione e delle PR di Google”.
3:07–3:12
“Invece che testare una cosa chiamata Chain of Thoughts, catena di pensieri — più domande per far funzionare meglio…”
3:18–3:21
“Si fa una cosa un po’ da stronzi…”
4:07–4:09
“84% GPT-4…” (Riferendosi ad MMLU Benchmark)
TecnicIAmo condanna l’asprezza del linguaggio esibito dal Sig. Flora e segnala che:
- La Chain of Thoughts, o Catena di Pensieri, non consiste in “più domande” come spiegato da Flora ma nell’induzione del modello alla risoluzione di un problema passaggio per passaggio — attraverso un unico prompt.
-
Il dato segnalato vocalmente da Matteo Flora non è corretto. Il dato corretto è 86,4% — o 86.4%, usando la notazione americana. In questo caso, Flora riesce nell’impresa quasi impossibile di sbagliare il dato anche avendolo davanti gli occhi, sullo schermo, ed esagerando così lo stacco fra Gemini e GPT-4 rinforzando, (se pur siamo sicuri, in buona fede) la sua “chiamata all’indignazione” (‘io sono incazzato come una bestia, ma dovreste esserlo anche voi’)
-
Non è “un po’ da stronzi” potersi permettere e/o usare techniche di prompting computazionalmente più esose su scala — ma il frutto di duro lavoro. Anche pensandola diversamente, la polemica non sarebbe rilevante perchè, come vedremo più avanti e a differenza di ciò che sostiene Flora, in realtà le comparazioni tra Gemini Ultra e GPT-4 sono effettuate con le medesime tecniche di prompting. Detto questo, Google ha grande esperienza con chip proprietari — le celebri TPU di Google sono internamente utilizzate almeno dal 2015. La compagnia possiede inoltre una linea di chip proprietari per smartphone, i cosiddetti “Tensor Gn”. In molti, all’interno della community, hanno avuto da ridire su questo genere di critiche e si riporta un tweet esemplificativo:

Contestualmente, si riporta che:

Microsoft, il principale cloud computing partner di OpenAI con la sua celebre infrastruttura “Azure”:

Ovviamente, conta tanto quanto il lato software, e da questo punto di vista al pubblico sono rilasciate poche informazioni.
— — — — — — — — —
4:18–4:27
“Guardate bene a sinistra: 32 passaggi di Chain of Thoughts. 32 Volte in cui gli dai esempi e roba varia contro… Cinque. Ops! E stessa cosa in fondo: 5 contro 32”.
4:32–5:02
“Cioè, è un po’ come se tu prendessi un bambino di una scuola di Milano e un bambino in una scuola di Savona e gli dicessi: “ciao bambino della scuola di Milano e di Savona, vi faccio le stesse domande e vi paragono. E viene fuori che il bambino di Milano va molto meglio del 10% meglio del bambino di Savona. Peccato che al bambino di Milano avete fatto 5 minuti di training, al bambino di Savona avete fatto mezz’ora di training sulla stessa domanda e, in un benchmark, cercate di fare uscire come se questa cosa sia la stessa”.
TecnicIAmo segnala profonde incomprensioni e “scambi” del Sig. Flora verso cosa significhi CoT@32, training, e few-shot. Inoltre, segnala che il Sig. Flora contraddice se stesso perché, seguendo il suo ragionamento, dovrebbe essere il bambino di Savona ad andare meglio del bambino di Milano, avendo fatto 30 minuti di training contro 5 del bambino di Milano.
- In CoT@32, 32 non sono gli esempi (né i passaggi sono 32) come affermato da Flora, ma i sample. Si assegna la risposta definitiva basandosi su un threshold del consenso. Per esempio, si immagini che la risposta sia la stessa alla fine della Catena (delle catene).*
*TecnicIAmo evidenzia questa sia una semplificazione, pur corretta.




La spiegazione di Paul Calcraft, PhD in scienza computazionale.
Queste informazioni erano presenti online già prima dell’upload del video da parte di Matteo Flora; quindi sarebbe stato facile documentarsi. Molto, facile, visto che le informazioni erano disponibili da più parti. Per esempio, io stesso avevo aggiunto alla spiegazione di Calcraft per fare chiarezza su Twitter, dovendo ovviamente adattare il mio linguaggio in base ai commenti precedenti — in modo che fosse più chiaro possibile.


Come avrete potuto già intuire, questa tecnica è utile in virtù della natura non-deterministica del modello.
-
Matteo Flora confonde il processo di training con il prompting few-shot, e viceversa.
-
Si nota che: il few-shot non è incompatibile con la CoT, nè con la CoT@32.
-
Di nuovo, si nota come Matteo Flora non abbia letto, o quantomeno non abbia ben assorbito, il contenuto del report tecnico e per la precisione la pagina 7 e pagina 46, dove viene riportato per GPT-4 il punteggio in CoT@32, ovvero la stessa modalità di prompting di GPT-4.
In particolare si nota che (pagina 46):

Quando utilizzato lo stesso prompting (CoT@32 Uncertainty-Routed), GPT-4 ottiene comunque un punteggio minore di Gemini Ultra. Di conseguenza, anche se Flora avesse capito di cosa stesse (tentando di) parlare, avrebbe comunque torto.
— — — — — — — — —
5:04–5:17
“Ce ne sono davvero una quantità di queste cose, che fa davvero paura! Il numero di risultati che sono alterati, non hanno le stesse condizioni, sono le stesse.” (Quando non capiamo ciò che dice l’interlocutore, riportiamo parola per parola, piuttosto che sbagliare nel riordinare la frase)
A sostegno di questa affermazione, Flora fornisce il seguente screenshot, su cui disegna (molto artisticamente) delle figure rosse:

TecnicIAmo segnala che:
La prima figura non ha senso; in quanto il prompting per Gemini Ultra e GPT-4 è identico, mentre Gemini Pro probabilmente utilizza CoT@8 in linea con l’essere un “taglio intermedio” tra Nano e Pro, e come tale Google ha probabilmente scelto di far automaticamente andare il modello su un CoT@8 per ridurre il carico computazionale. D’altronde, la versione Pro è gratuita. Che la valutazione per GPT-4 sia svolta “via API” potrebbe addirittura essere a favore di OpenAI, perchè GPT via API paga meno alignment tax, risultando dunque leggermente più performante. Ma solo perchè il modello è più performante, non esclude che la piattaforma possa ottenere un punteggio ancora migliore. Purtroppo sono entrambi sistemi chiusi, quindi impossibile vederci chiaro qui. La specificità di Google (vedi inserire “IT”) ci fa pensare che Google non stia utilizzando soluzioni alla code interpreter di OpenAI senza dirlo, quindi Gemini sembra effettivamente più performante qui e continueremo con quest’assumption per il resto dell’articolo
-
La seconda figura non ha senso; in quanto il prompting per tutti e 3 i modelli è identico. È indicato “reported” perché la valutazione era già disponibile, quindi Google non si è scomodato (seguiamo il maschile di Flora) a rifarla.
-
La terza figura non ha senso e dimostra, ancora una volta che, il Sig. Flora non ha letto o quantomeno non ha ben assorbito il report tecnico. In particolare, con le informazioni della pagina 6 si può notare come il prompting per tutti e 3 i modelli sia identico:
“In mathematics, a field commonly used to benchmark the analytical capabilities of models, Gemini Ultra shows strong performance on both elementary exams and competition-grade problem sets. For the grade-school math benchmark, GSM8K (Cobbe et al., 2021), we find Gemini Ultra reaches 94.4% accuracy with chain-of-thought prompting and self-consistency (Wang et al., 2022) compared to the previous best accuracy of 92% with the same prompting technique.” (Fonte: Report tecnico).
- La quarta figura non ha senso, perché il prompting è lo stesso per tutti e 3 i modelli (0-shot, in tutti e 4 i casi)
Nota tecnica TecnicIAmo: “Nel contesto del report tecnico Gemini, “IT” è probabile si riferisca a “Instruction Tuning”
— — — — — — — — —
5:20–5:34
“Vi ricordate quando qualche settimana fa, Altman aveva presentato il nuovo GPT, cioè GPT Turbo? Quello che ha fatto un po’ impressione perché era multimodale, faceva tante cose eccetera”.
TecnicIAmo segnala che, al contrario di ciò che dice Flora:
- GPT Turbo non esiste. O meglio, esiste ma non è in alcun modo ciò che pensa Flora.
- GPTn, per quanto ne sappiamo, fin ora non è mai stato multimodale (sebbene lo sia il sistema nel suo insieme). Questo perché non si tratta di un unico modello, un modello universale, nativamente multimodale, come Gemini di Google, ma di un modello che si interfaccia con altri.*
*Semplificazione a fini giornalistici.
-
La multimodalità non è stata una novità introdotta con GPT-4 Turbo e, non fosse così, OpenAI non avrebbe potuto pubblicare la sua partnership con Be My Eyes il 14 di Marzo. Come, del resto, Google non avrebbe potuto eseguire la comparazione con GPT-4V — si noti che OpenAI già il 25 Settembre rilasciava la System Card per GPT-4V:
-
Non si capisce quale sia il ruolo de “faceva tante cose” nella frase — GPT-4 Turbo fa niente più del precedessore. Da segnalare invece la riduzione del costo computazionale e, anche di conseguenza, l’espansione della finestra di contesto. Un cambiamento non epocale: 32000 token* per la versione Chat (esattamente come Gemini)
Nota tecnica TecnicIAmo: in realtà ci può essere una leggera variazione da un modello all’altro dovuta all’uso di tokenizzatori diversi.
— — — — — — — — —
5:36–5:50
“Non è quello, con cui l’hanno confrontato - ovviamente. Il confronto è stato fatto tra Gemini Ultra […] contro la versione di Aprile di GPT-4”
TecnicIAmo segnala che: le affermazioni del Sig. Flora risultano fuorvianti.
Matteo Flora si riferisce al modello -0613 di GPT-4, omettendo informazioni critiche al contesto:

Fonte: OpenAI
TecnicIAmo segnala che:
GPT-4–0613 non è solamente stato “rilasciato ad Aprile” — ma è anche l’ultimo rilasciato prima della versione -1106. Come visibile da screenshot e link OpenAI, la versione -1106 è una versione preview, e sarebbe scorretto eseguire una comparazione contro di essa, perché non è una release stabile e i risultati potrebbero non essere ottimali. In particolare, non solo potrebbero non essere ottimali, ma è OpenAI stessa a dichiarare grandi problemi con la versione -1106. Ecco una delle tante prove disponibili:

TecnicIAmo segnala inoltre che:
Anche immaginando una comparazione con GPT-4–1106 all’immediata presentazione di GPT-4 Turbo, non è scontato che il punteggio di GPT sarebbe stato più alto. Infatti, avrebbe potuto addirittura essere più basso. Questo perché per rendere più performante il modello, OpenAI potrebbe essere ricorsa alla quantizzazione o, quantomeno, ad una quantizzazione “maggiore” — così come si dicesse per GPT-3.5 Turbo. In questo caso è presente un incentivo a limitare l’impatto sulle metriche effettuando fine-tune ed aggiornando la cut-off date in un modo tale da far scofanare i training set ed avere metriche più alte sui benchmark pur perdendo capacità di generalizzazione. Ovvero equivarrebbe a copiare e restare ignoranti invece di studiare — appunto che riserviamo a M. Flora per i prossimi secondi del video, dove parla nuovamente de il bambino di Milano ed il bambino di Savona.
TecnicIAmo segnala in particolare che:
In alcuni casi, GPT-4 Turbo (GPT-4–1106), quando comparato con il suo predecessore, ha ottenuto dei punteggi più bassi. Exempli Gratia:



TecnicIAmo segnala altresì che:
Al meglio delle nostre conoscenze,
Non essendo stata rilasciata alcuna documentazione, come o simile ad un technical report da OpenAI riguardo il modello GPT-4 Turbo (GPT-4–1106), né alcuna rassicurazione di OpenAI quantomeno verbale, e soprattutto essendo stato aggiornata la cut-off date del sopramenzionato GPT alla data di Aprile 2023 (come da screenshot e link OpenAI) — le probabilità che il dataset di OpenAI sia, come si dice in gergo, contaminato — sono altissime, per non dire che è quasi certo. Questo pertanto, esclude a priori la possibilità da parte dell’industria di comparare un modello come Gemini con GPT-4 Turbo (GPT-4–1106).
TecnicIAmo fa in particolare notare che:
OpenAI ha già avuto episodi di enorme — quasi certa contaminazione, ed ecco le prove:

(Horace He, Università Cornell)
Purtroppo, anche da qui si evince l’esiguo bagaglio tecnico inteso come adeguato a comprendere il funzionamento de gli LLM o un report tecnico su di essi. da parte del Sig. Flora— almeno stando alle esperienze dichiarate sull’homepage del suo sito ufficiale. Di nuovo: con questo non vogliamo dire che non esista, ma che noi non ne abbiamo trovato traccia.
— — — — — — — — —
6:18–6:29
“Già così dovrebbe farvi capire quanto c’è da vergognarsi come dei ladri e quanto i giornalisti che hanno rilanciato quanto era meglio, dovrebbero chiudersi in casa a piangere -ok”
6:30–6:41
“Seguire le veline che ti da l’ufficio stampa non è fare informazione. Seguire le veline è, ci sono tanti altri modi offensivi per definirlo. Però — come l’ho beccato io in 5 minuti guardando su Twitter non era così difficile, beccarlo”
Alla luce di quanto fin ora riportato, pensiamo non sia “ok” e ci domandiamo se il Sig. Flora si ‘chiuderà in casa a piangere’, essendo fra quelli che hanno rilanciato cose senza capire ciò che rilanciassero. Speriamo di no — non auguriamo ciò a nessuno ma, ecco una preziosa risorsa in caso ve ne fosse bisogno.
Sulla seconda affermazione, invece, concordiamo in pieno. A questo punto, però, non possiamo fare a meno di chiederci perché Flora non abbia letto, o quantomeno non abbia letto più attentamente, il report tecnico. Ci consoliamo con l’ammissione dei 5 minuti su Twitter. Forse questo campo richiede più, dei 5 minuti su Twitter.
— — — — — — — — —
6:47–7:13
“Non è ancora finito eh, se vi dicessi che non hanno risposto alle stesse domande? È lo stesso, sempre Dobos che dice: attenzione perché — le hanno proposte a tutte e due, Gemini e GPT-4 in modo diverso, facendo in modo che le risposte fossero più adatte a Gemini per fare le varie parti e fa vedere l’appendice proprio di come sono state fatte”
TecnicIAmo segnala che:
Al contrario di ciò che viene affermato, le domande non cambiano. Vengono messi a grafico i risultati di 3 tecniche di prompting, con risultati per ambuedue modelli in ogni tecnica messa a grafico. Dal grafico, si evince che la migliore per entrambi i modelli, dal punto di vista del punteggio, è la CoT@32 (Uncertainty-Routed). È dunque vera, o falsa l’affermazione che si è fatto in modo che “le risposte fossero più adatte a Gemini” (un po’ di licenza poetica)? È presto detto:
In questo tipo di valutazioni, quando si vuole indicare che è presa in considerazione la risposta migliore, (nel nostro caso, fra 32) è presente la voce “Best of n”. Nel nostro caso, se la comparazione fosse non equa dal punto di vista dell’output, (come vediamo, è equa dal punto di vista dell’input) dovrebbe figurare la voce “Best of 32”. Tale voce non è presente, quindi anche quest’ultima affermazione di Flora risulta falsa.

— — — — — — — — —
7:14–7:30
“Te lo spiego in un modo diverso, in 32 passaggi invece che 5, ti paragono alla versione precedente, e vinco. Ma tu guarda che cosa strana! Ma(h), fosse solo questo, sarebbe una roba un po’ da nerd, lo posso capire — cioè una roba che fa incazzare i ricercatori…”
TecnicIAmo segnala un altro profonda incomprensione di Matteo Flora sulle tecniche di prompting:
Come già spiegato sopra, non sono i passaggi ad essere 32. In realtà il numero di passaggi è variabile poiché la tecnica, come già evidenziato, è la seguente:

Il punto è che, a dirla proprio tutta, nemmeno nel 5-shot i passaggi sono cinque —ma vi risparmiamo la spiegazione di quest’altro tecnicismo.
Inoltre, continuiamo ad avere l’impressione che Matteo Flora confonda CoT@n con Few-Shot n.
Infine, come abbiamo già visto, non esiste un’altra versione di GPT-4 con cui fosse opportuno o profittevole per il punteggio di GPT fare il paragone, per le ragioni già sopra elencate. Abbiamo l’impressione di ascoltare un disco rotto.
— — — — — — — — —
7:39–7:46
“Quello che fa incazzare come una vipera me; è altro. È che vi hanno preso bellamente per i fondelli — anche con il video di presentazione”
12:02–12:21
“Tutte le varie parti… Non ce n’è uno che è fatto in quel modo, cioè sono tutte prese in giro fatte con degli screenshot — unA sacco di spiegazioni, con immaginazione spiegazioni immagini spiegazioni immagini spiegazione dei passaggi… Preso l’ultima risposta, e buttata all’interno, del video.”
TecnicIAmo ha analizzato il video e la pagina a cui fa riferimento Flora come prova, e può provare la falsità dell’affermazione di Flora.
Riportiamo insieme alcuni esempi della pagina a cui fa riferimento Flora come prova, e compariamoli con i risultati ottenuti dal “taglio intermedio” — Gemini Pro (a vantaggio di Flora) e nemmeno “calibrato” per il dialogo — per l’esperienza chat (di nuovo, a vantaggio di Flora):
Ecco due delle fantomatiche prove di Flora:

Fonte: Blog di Google **per Sviluppatori**
E compariamole con l’output straight-from-Gemini:


Fonte: Oriol Vinyals, VP of Research & Deep Learning Lead, Google DeepMind. Gemini co-lead.
Abbiamo lasciato Flora considerevole margine, e nemmeno così è stato necessario specificare i dettagli presenti nella pagina How It’s made (Developers Google Blog).
In particolare, si noti che:
Nella terza immagine (gemella con la prima), “Consider the distance from the Sun and explain your reasoning.” È assente — in favore di una domanda diretta.
Nella quarta immagine (gemella con la seconda), non c’è alcun riferimento al fatto che l’oggetto sia una macchina e manca altresì il “explain why, using visual specific details.” Di nuovo, in favore di una domanda diretta.
Nota Bene: si potrebbe considerare “based on their design” superfluo, quando è in realtà essenziale a ciò che vogliamo, in questo caso, sapere: non è infatti scontato che la macchina a destra vada più veloce semplicemente perché più aerodinamica. In ogni caso, anche rimuovendo questa informazione, il modello saprebbe comunque rispondere.
Analizziamo altri 2 esempi, ma stavolta dal video per cui Flora si dice “incazzato come una vipera”:


Fonte: Oriol Vinyals, VP of Research & Deep Learning Lead, Google DeepMind. Gemini co-lead.
Vale ciò scritto sopra.
Minuti video, prima immagine: 4:36
Minuti video, seconda immagine: 4:09
Si riporta contestualmente che:
Shane Legg, (Co-founder and Chief AGI Scientist, Google DeepMind) il 7 Dicembre, scrive su Twitter: “and yet it’s actually real!” (“Eppure, è davvero reale!”) - Confermando sostanzialmente l’ovvio: essendo Gemini un modello nativamente multimodale con training su video, Google ha già tutti gli strumenti per questo tipo di interazioni in tempo reale, ma sarebbe troppo costoso scalarla adesso a molti utenti. Tra alcuni mesi, chissà. Del resto, come evidenzia Flora, Gemini Ultra non è ancora stato scalato agli utenti — ci chiediamo dunque di che si lamenti.

Si riporta contestualmente che:
Implementazioni simili avevano già riscosso fama da circa 1 mese.
Attenzione: non essendo GPT-4 nativamente multimodale con training su video, brevi video come questi possono costare centinaia di dollari in chiamate API.
La pagina a cui si riferisce Flora fa la stessa cosa dello screenshot del video qui sotto, evidenziando il contrasto con le possibilità che apre un modello nativamente multimodale. Evidentemente, non è stato afferrato. Se il blog si chiama Blog di Google PER SVILUPPATORI, ci sarà un motivo.


Non possiamo che rallegrarci che questa “controversia” abbia popolarizzato questa modalità di interazione: è benzina per l’ottimizzazione necessaria a raggiungere l’adozione di massa.
— — — — — — — — —
Durante il resto del video, Flora persevera in affermazioni già ampiamente smentite più volte — dunque, riteniamo così la verifica già sufficiente.
Concludiamo facendo notare che non comprendiamo come possa mai essere considerata “pubblicità ingannevole” un video simile, essendo indicato sia ad inizio che fino video di cosa si tratti.
— — — — — — — — —
Si ringrazia Drew Hawkswood (@DrewHawkswood) per la segnalazione
Verifica da: Marco Pinnisi
✅
메타데이터
- post_id
- f334a2276ed0
- slug
- perchè-il-video-di-matteo-flora-su-google-gemini-non-corrisponde-a-verità-f334a2276ed0
- url
- https://medium.com/@TecnicIAmo/perch%C3%A8-il-video-di-matteo-flora-su-google-gemini-non-corrisponde-a-verit%C3%A0-f334a2276ed0
- canonical_url
- https://medium.com/@TecnicIAmo/perch%C3%A8-il-video-di-matteo-flora-su-google-gemini-non-corrisponde-a-verit%C3%A0-f334a2276ed0
- author_url
- https://medium.com/@TecnicIAmo
- status
- ok
- fetched_at
- 2026-07-24 18:52:03