Команда DeepReinforce анонсировала инновационную систему CUDA L2, которая автоматически создает GPU код для матричного умножения. Эта методика позволяет достигать производительности, опережающей стандартные библиотеки cuBLAS и cuBLASLt на 10–30%. В отличие от привычных подходов, CUDA L2 использует комбинацию языковой модели и обучения с подкреплением, что позволяет создавать код, адаптированный под конкретные размеры матриц.
Генератор DeepSeek 671B, дообученный на высококачественных примерах CUDA ядер, обрабатывает тысячи конфигураций, что расширяет область применения. Тестирование показало, что в оффлайн режиме система быстрее torch.matmul и cuBLAS в среднем на 17–22%, а в серверном сценарии ускорение достигает 24–29%.
Разработчики уже представили набор оптимизированных A100 ядер и планируют расширить метод на новые архитектуры. Эксперты считают, что CUDA L2 может задать новый стандарт в области оптимизации, где языковые модели станут основными инструментами для повышения производительности.