Tweet

5.288 tweets12 añosúltimo 17 ago 2026

Una entrada del archivo público.

← volver a todos los años

@iScienceLuvr The improvement in test-time compute is clear, but did the 100k+ GPUs actually lead to a significant improvement in pre-training?