approfondimento

GPT-6 Astra alla prova: 17 minuti per costruire, 83 secondi per correggere


Indirizzo copiato

Ecco come far realizzare software a GPT-6 Astra, cronometro alla mano: un simulatore orbitale, un gioco e due modifiche sullo stesso file. La fisica regge alla verifica esterna anche sulle orbite ellittiche; il numero che conta per un’azienda non è quanto ci impiega la prima volta ma quanto costa la seconda richiesta, dove si arenano i prototipi

Pubblicato il 18 set 2026

Fabio Lalli

Consulente in trasformazione digitale – AI & product strategy



AI Questions Icon
Chiedi all'AI
Riassumi questo articolo
Approfondisci con altre fonti
GPT-6 Astra




Un simulatore non si giudica guardandolo. Si giudica prendendo i numeri che produce e andando a verificarli fuori, con una calcolatrice e una legge della fisica che non dipende da chi ha scritto il codice.

È quello che abbiamo fatto il 16 settembre, aprendo una sessione di GPT-6 Astra al livello di sforzo Max e dandole due compiti di seguito, più due modifiche successive sul secondo. Non ci interessava sapere se produceva qualcosa di bello, quello lo fanno tutti i modelli da un anno. Ci interessava sapere se produceva qualcosa di giusto, e soprattutto cosa succedeva quando le chiedevo di cambiare una cosa che già funzionava.

Tre richieste, un cronometro e una calcolatrice

Un simulatore orbitale interattivo in un file HTML autonomo, con slider e un pannello di misura. Un gioco giocabile nel browser, genere a sua scelta. Poi, sul gioco, due modifiche: una funzionale che tocca più strati del software, una chirurgica che sposta un solo parametro.

Abbiamo cronometrato a orologio, annotato i tempi che l’interfaccia dichiara e verificato i risultati fuori dallo strumento dove era possibile. Un avvertimento pratico per chi vuole rifare la prova: partendo dalla schermata vuota, ChatGPT attacca in testa al campo di testo un riferimento alla generazione di immagini, e se resta lì dirotta la richiesta. L’ho tolto prima di inviare.

Quello che non abbiamo verificato lo scrivo dove capita, perché un test senza il perimetro dichiarato vale poco. Un solo tentativo per compito, nessuna ripetizione sistematica, nessun confronto con altri modelli sulle stesse richieste.

Il simulatore mi ha spiegato come smentirlo

La prima richiesta era un simulatore con un corpo centrale e tre pianeti, gravità newtoniana integrata numericamente, slider su massa, distanza e velocità iniziali, scie orbitali, e un pannello che mostrasse in tempo reale raggio medio e periodo misurato. Ho specificato il motivo: voglio leggere quei numeri e verificare da solo la terza legge di Keplero.

Venti secondi dopo l’invio, Astra ha dichiarato cosa avrebbe usato, la skill di visualizzazione per l’interfaccia e quella dei file per la consegna. A cinquanta secondi si era costruita una scaletta in tre punti, e il terzo era verificare fisica e interazioni prima di consegnare. Poi la riga di stato è passata a controllare ambiente e runtime disponibili.

Abbiamo lavorato sedici minuti e nove secondi. Il risultato gira offline, con sette slider, pausa, avanzamento di un anno per volta, ritmo regolabile, scie e un pulsante per esportare le misure in CSV. Accanto a ogni pianeta compaiono la velocità circolare e la velocità di fuga calcolate per quella distanza, e nell’intestazione ha scritto «Le orbite, misurate», che come dichiarazione d’intenti è più onesta di molte demo.

Nella consegna ci ha anche spiegato come metterla alla prova: attendere un giro completo per leggere il periodo, e confrontare il rapporto tra quadrato del periodo e cubo del semiasse, ricordando che nelle ellissi serve il semiasse maggiore, che infatti mostra accanto al raggio medio. Mi ha consegnato lo strumento per falsificarla, cosa che un artefatto costruito per impressionare non fa quasi mai.

Il pannello, che ha chiamato banco di misura, riporta nuovi risultati a ogni giro completato. Al primo giro dava valori ancora grezzi, con i pianeti esterni non disponibili perché non avevano chiuso l’orbita. Dopo qualche decina di giri i numeri si erano stabilizzati: pianeta A con semiasse 0,89998 unità astronomiche e periodo 0,85378 anni, pianeta B con 1,50005 e 1,83722, pianeta C con 2,30004 e 3,48822.

Li ho presi e ho rifatto il conto fuori. Il rapporto tra il quadrato del periodo e il cubo del semiasse, che per la terza legge di Keplero deve valere uno, viene 0,999985, 1,000012 e 1,000004. Scarti nell’ordine del centomillesimo su un intervallo di raggi che va da nove decimi a 2,3 unità astronomiche. Controprova indipendente, perché un solo rapporto può essere fortuna: il periodo di C diviso quello di A fa 4,086, e il rapporto dei loro raggi elevato a tre mezzi fa 4,086.

PianetaSemiasse a (UA)Periodo T (anni)T² / a³Scarto dal valore teorico
A0,899980,853780,999985−0,0015%
B1,500051,837221,000012+0,0012%
C2,300043,488221,000004+0,0004%
Verifica dell’autore sui valori letti dal pannello del simulatore. Il valore teorico della terza legge di Keplero è 1,000000

Con le orbite circolari, però, il test è gentile, perché raggio medio e semiasse coincidono e sbagliare è difficile. Allora ho alzato la velocità iniziale del pianeta più interno da 31,396 a 40,796 chilometri al secondo, dentro la fascia tra velocità circolare e velocità di fuga, e ho ottenuto un’ellisse pronunciata. Qui i due valori si separano: il raggio medio segna 3,57268 unità astronomiche, il semiasse 2,88831, quasi sette decimi di differenza.

È esattamente il punto dove un simulatore scritto male si tradisce, perché usare il raggio medio al posto del semiasse dentro la legge di Keplero è l’errore classico e produce numeri plausibili ma sbagliati. Rifatto il conto sui tre pianeti in configurazione ellittica, il rapporto viene 1,000000, 1,000008 e 1,000001. Usa il semiasse, come deve, e lo scrive anche in una nota sotto la tabella.

Il simulatore consegnato da GPT-6 Astra, con il pianeta A portato su un’orbita ellittica. Schermata dell’autore.

Ho spinto il pianeta oltre la velocità di fuga

Una simulazione generata si tradisce agli estremi, non al centro. Il pannello indicava per il pianeta A una velocità circolare di 31,40 chilometri al secondo e una velocità di fuga di 44,40. Ho portato il valore a 45, appena sopra la soglia, e ho guardato.

Il pianeta se n’è andato, come doveva. In tabella il raggio medio è salito a 8,33564 e al posto del periodo è comparsa la dicitura di orbita aperta con periodo non definito, mentre il rapporto di Keplero è passato a non disponibile. Non ha prodotto un numero privo di senso e non è andato in errore: ha riconosciuto che la traiettoria era diventata iperbolica e ha smesso di misurare una cosa che non esiste più.

Nella consegna c’è però una riga che Astra ha scritto da sola, e che vale il resto della sezione: fisica numerica e logica dei controlli verificate, anteprima visiva bloccata dalla policy del browser di test. Si era messa in scaletta una verifica visiva, non è riuscita a portarla a termine, e invece di tacere lo ha dichiarato. Quel simulatore, prima che lo aprissi io, non lo aveva visto nessuno. Per chi deve decidere se mettere un modello dentro un processo aziendale, saper distinguere ciò che si è verificato da ciò che non si è potuto verificare conta più di qualunque punteggio di benchmark.

Ventiquattro test che nessuno aveva chiesto

La seconda richiesta era volutamente vaga: un gioco giocabile nel browser, condizione di vittoria chiara, almeno due livelli a difficoltà crescente, genere e grafica a sua scelta, comandi da tastiera, funzionante offline.

A diciotto secondi dall’invio, la riga di stato diceva una cosa che non mi aspettavo in una chat vuota: individuazione dei file AGENTS.md. Stava cercando un file di istruzioni di progetto prima di scrivere una riga di codice, cioè si comportava come un agente dentro un repository anche in assenza di un repository.

In un’azienda vera quel comportamento significa che seguirebbe le convenzioni del team invece delle proprie.

Diciassette minuti e quarantaquattro secondi dopo è arrivato Echo Shift, un arcade di esplorazione spaziale con tre livelli invece dei due richiesti: raccogli i nuclei energetici, evita i droni, raggiungi il portale. Comandi su WASD o frecce, scatto protettivo sulla barra spaziatrice, pausa, ripetizione del livello, audio commutabile, un pannello obiettivi con i tre settori e la legenda degli elementi. Quando ho lasciato la finestra si è messo in pausa da solo, con un messaggio scritto in tono di gioco che nessuno aveva chiesto.

Echo Shift dopo la seconda iterazione, con il conto alla rovescia del nucleo instabile. Schermata dell’autore.

Poi la richiesta che separa una demo da un ambiente di sviluppo. Ho chiesto due aggiunte insieme: un record persistente che sopravvivesse alla chiusura del browser, con i tre migliori tempi per ciascun livello, e una meccanica nuova, un nucleo instabile che esplode dopo cinque secondi e va quindi raccolto per primo. Nient’altro doveva cambiare.

Nove minuti e nove secondi. Le due funzioni c’erano entrambe, e nella consegna ha scritto due frasi che ho riletto tre volte. La prima: il resto del gioco è invariato, superati ventiquattro test automatici. Non avevo chiesto nessun test. Ha scritto una suite e l’ha eseguita prima di consegnare, e nelle otto schede dimostrative pubblicate da OpenAI al lancio questo comportamento non compare.

La seconda frase è ancora più significativa: la pausa ferma il timer. Nessuno gliel’aveva detto. Ha capito da sola che introdurre un conto alla rovescia dentro un gioco che ha già una funzione di pausa apre un caso limite, e lo ha chiuso prima che diventasse un difetto. È il tipo di ragionamento sulle interazioni tra funzionalità che di solito manca ai prototipi generati, ed è anche il tipo di dimenticanza che in produzione costa una segnalazione e un ciclo di correzione.

La modifica più piccola possibile

Restava l’ultima misura, quella che nessuna demo racconta. Ho chiesto di portare il conto alla rovescia del nucleo instabile da cinque a otto secondi, nient’altro.

Un minuto e ventitré secondi. Risposta di una riga: conto alla rovescia portato a otto secondi, nient’altro modificato.

La cosa interessante l’ho vista aprendo il file. Quel numero non compariva in un punto solo: stava nella schermata iniziale che spiega le regole, nel riquadro laterale delle istruzioni e nel contatore che scorre durante la partita. Li ha aggiornati tutti e tre, senza che glielo dicessi e senza toccare altro. Una sostituzione cieca del valore avrebbe lasciato almeno un testo a parlare di cinque secondi mentre il gioco ne contava otto, ed è il genere di incoerenza che passa i controlli automatici e arriva in produzione.

Messi in fila, i tre numeri sullo stesso file raccontano una storia precisa. Diciassette minuti e quarantaquattro secondi per costruirlo da zero, nove e nove per una modifica che tocca persistenza e logica di gioco, un minuto e ventitré per spostare un parametro. Il costo dell’iterazione scala con la dimensione del cambiamento.

Elaborazione dell’autore sui tempi dichiarati dall’interfaccia di ChatGPT, sessione del 18 settembre 2026

Sembra ovvio ma non lo è affatto. Un modello che riscrive l’intero file a ogni richiesta impiega più o meno lo stesso tempo qualunque cosa gli chiedi, e ogni riscrittura è un’occasione per rompere qualcosa che funzionava. È il motivo per cui molti prototipi generati muoiono alla terza iterazione, con ogni correzione che ne introduce altre due. Una curva che scende da diciassette minuti a ottantatré secondi dice che l’intervento è mirato, e che la base di codice resta stabile mentre cresce.

Il numero da portare in una discussione

C’è un filo che attraversa le due prove, e non riguarda la velocità. Sul simulatore ha dichiarato cosa aveva verificato e cosa non era riuscita a verificare. Sul gioco ha scritto ed eseguito ventiquattro test che non le avevo chiesto. Produce, controlla e dichiara l’esito del controllo, ed è un comportamento che cambia il modo in cui un responsabile tecnico può delegare un compito.

Chi valuta questi strumenti per un’azienda continua però a guardare il primo colpo, cioè la cosa che si presta meglio a essere mostrata in una riunione. È la metrica sbagliata, perché il primo colpo lo passano quasi tutti i modelli in circolazione da mesi.

Le domande che contano vengono dopo. Quanto costa la seconda richiesta rispetto alla prima? Se il modello, quando gli chiedi di non toccare il resto, effettivamente non tocca il resto. Se verifica prima di consegnare, e se dichiara quando non è riuscito a verificare. La risposta è stata positiva su tutti e quattro i punti, con un campione minuscolo e senza ripetizioni, il che vuol dire che è un indizio e non una prova.

Due cose non le ho verificate e le scrivo qui invece di lasciarle implicite. Che i record del gioco sopravvivano davvero alla chiusura del browser lo dichiara Astra, e nelle partite che ho fatto i tre migliori tempi per settore risultavano ancora vuoti. E i ventiquattro test automatici non li ho visti eseguire, ho letto la dichiarazione nella consegna. Finché non faccio quelle verifiche restano affermazioni del fornitore, per quanto circostanziate.

Resta il vincolo che nella mia esperienza decide davvero il ritorno. Tutto quello che ho misurato è avvenuto dentro un ambiente che Astra controllava per intero, file autonomi senza dipendenze esterne e senza il peso di un sistema già in esercizio. In un repository aziendale con quindici anni di stratificazioni, quei numeri saranno altri numeri.

La cosa sensata da fare, prima di firmare qualunque licenza, è rifare esattamente questa misura sul proprio codice, con il cronometro alla mano: costruzione, modifica funzionale, modifica minima. Sono tre numeri, si ottengono in un pomeriggio, e dicono più di qualsiasi tabella comparativa.

Partecipa alla community

guest

0 Commenti
Più recenti
Più votati
Inline Feedback
Vedi tutti i commenti

Articoli correlati

0
Lascia un commento, la tua opinione conta.x