NVIDIA презентовала NVFP4, инновационный формат чисел, предназначенный для обучения крупных языковых моделей, использующий всего четыре бита на число, в отличие от традиционных восьми или шестнадцати. Этот метод позволяет практически не терять точность вычислений, увеличивая скорость обучения в два-три раза и сокращая потребление памяти на пятьдесят процентов. В ходе эксперимента компания обучила 12-миллиардный Mamba Transformer на десяти триллионах токенов, и результаты модели с использованием 4-битного NVFP4 оказались сопоставимы с FP8 по тестам MMLU Pro и задачам программирования MBPP+. Структура NVFP4 группирует значения в блоки по шестнадцать чисел, при этом для каждого блока используется небольшой масштаб в восьми битах, а для всего тензора — глобальный масштаб в 32 бита. Это обеспечивает сохранение точности как локальных, так и экстремальных значений, что гарантирует стабильность обучения даже при компактном хранении данных. Также применяется стохастическое округление для предотвращения накопления ошибок, а переход на BF16 на последних итерациях полностью устраняет оставшиеся различия. Формат NVFP4 уже поддерживается в Transformer Engine и новом поколении графических процессоров Blackwell, где операции с FP4 выполняются в два-три раза быстрее по сравнению с FP8, а потери точности при валидации составляют всего один-полтора процента. NVFP4 значительно ускоряет обучение крупных языковых моделей, сокращает энергопотребление и повышает эффективность вычислительных ресурсов, открывая новые возможности для исследователей и разработчиков в области ИИ.