Разработка MedASR, специализированного инструмента для преобразования речи в текст в сфере медицины, основана на архитектуре Conformer и включает 105 миллионов параметров. Обучение модели проводилось на 5000 часах обезличенной медицинской речи, охватывающей различные области, такие как радиология и семейная медицина. Это позволяет более точно распознавать специализированные термины и разговорную речь пациентов. MedASR принимает моноаудио 16 кГц и предоставляет текстовую расшифровку без анализа смысла. Разработчики предполагают использование этой модели как основы для голосовых приложений в здравоохранении, улучшая расшифровку радиологических заключений и бесед между врачами и пациентами. MedASR также можно адаптировать для специфических задач, например, под акценты и шумные условия. Для извлечения смысла из расшифровок можно использовать генеративные модели, такие как MedGemma.