Андрей Карпати, экс-директор по искусственному интеллекту в Tesla, разработал модель, которая превзошла GPT-2 по показателям теста CORE, используя всего $73 и затратив три часа на одном из восьми GPU H100. В отличие от этой новой модели, тренировка оригинальной GPT-2 (с 1,5 млрд параметров) в 2019 году занимала более недели на 32 чипах TPU v3 и стоила около $43 000. Уменьшение стоимости обучения в 600 раз за прошедшие семь лет стало возможным благодаря улучшению железа, программного обеспечения (Flash Attention 3, torch.compile) и алгоритмических находок, таких как оптимизатор Muon. По словам Карпати, каждый год цена обучения GPT-2 снижается примерно до 40% от предыдущего уровня. Проект nanochat состоит примерно из 1000 строк кода, использует 768 млн параметров и современные архитектурные решения, включая RoPE и RMSNorm. Также Карпати запустил лидерборд, на котором команды соревнуются в скорости обучения моделей до уровня GPT-2, и текущий рекорд держится на 3,04 часа.