Test-time compute

Far "pensare più a lungo" il modello prima di rispondere: più calcolo (e più costi) in fase di uso, per risultati migliori su problemi complessi.

Definizione di Super Squalo ·
Fino al 2024 per avere risposte migliori si allenavano modelli più grandi (più soldi in fase di costruzione). Il test-time compute rovescia la logica: un modello di dimensione fissa può ottenere risultati superiori spendendo più calcolo nel momento della risposta — generando ragionamenti interni, provando strade diverse, autocorreggendosi prima di rispondere. È la tecnica dietro i modelli di ragionamento (o1, o3, DeepSeek R1, le versioni "thinking"). La manopola è regolabile: più "tempo di pensiero" per problemi difficili, meno per domande semplici. Conseguenza pratica per chi usa i tool: le versioni reasoning costano di più e rispondono più lentamente, ma su matematica, codice e analisi complesse la differenza è netta. Regola: domande semplici con modelli normali, problemi veri con modelli di ragionamento — pagare il pensiero profondo per riassumere un’email è spreco.