Создатель Redis представил инференс модели Voxtral на чистом C

Сальваторе Санфилиппо, известный как antirez, выложил на GitHub новый проект под названием voxtral.c — это реализация инференса модели Voxtral Realtime 4B от компании Mistral на языке программирования C. Данная модель, имеющая 4 миллиарда параметров, позволяет преобразовывать речь в текст и функционирует как с микрофонов, так и с аудиофайлов, при этом весь процесс сборки можно осуществить командой make. Замечательно, что проект не имеет внешних зависимостей, таких как Python, PyTorch или vLLM.

Модель Voxtral Realtime 4B — это потоковая модель speech-to-text от Mistral, основанная на Ministral 3B и использующая аудиоэнкодер Whisper large-v3. Она поддерживает аудио длительностью до 30 минут и работает с контекстом до 32 000 токенов. Размер моделей составляет около 8,9 ГБ и она доступна по лицензии Apache 2.0. Официально Mistral предоставляет возможность запуска через vLLM, однако реализация от antirez делает это без дополнительных программ.

Проект поддерживает ускорение на Apple Silicon с помощью Metal Performance Shaders и OpenBLAS на Linux. Кроме работы с файлами, voxtral.c также может захватывать звук с микрофона в реальном времени на macOS и принимать аудио через stdin, что позволяет обрабатывать различные форматы с помощью ffmpeg. В репозитории также имеется простая версия на Python для тех, кто хочет ознакомиться с архитектурой модели, не углубляясь в код vLLM. Это уже третья работа antirez в серии «ИИ на чистом C». Ранее он выпустил flux2.c для генерации изображений и gte-pure-C для получения текстовых эмбеддингов, все три проекта написаны с использованием Claude Code и содержат файл CLAUDE.md. Серия продолжает минималистичную линию llama2.c от Андрея Карпати, демонстрируя, что для нейросетей не требуется сложный ML-стек.

Понравилась статья? Поделиться с друзьями:
Сайт для студентов