В мире глубокого обучения, где обычно используются сложные библиотеки, как PyTorch и TensorFlow, Андрей Карпаты радикально изменил подход. Он поделился кодом microGPT, представляющим собой всего 240 строк чистого Python. Эта модель обучается на базе имен, генерируя новые, несуществующие имена, использую лишь базовую математику и особенности языка Python.
microGPT не требует внешних зависимостей, лишь несколько стандартных модулей, таких как os и random. Этот проект, названный Карпатами «арт-проектом», на самом деле является отличным образовательным инструментом для понимания принципов работы языковых моделей.
Каждый элемент кода объясняет работу нейросети, начиная от токенизации, где символы превращаются в числа, и заканчивая основными алгоритмами, которые лежат в базе учебного процесса. Модель использует тот же алгоритм, что и более крупные мутации вроде ChatGPT, но на уменьшенном масштабе.
С запуском microGPT Андрей показывает, что идеи, лежащие в основе крупных моделей, не так сложны, как могут показаться, а презентация кода в таком виде делает их доступными для широкой аудитории.