Voice AI Studio
github.com/Tensionix/voice-ai-studio ↗
Тот же движок, что в лёгкой сборке, но со всем стеком сразу: тяжёлые модели, ускорение на видеокарте, полный набор экспортов. Диктовка, рекордер аудио и действия из трея и оверлея — на месте, модели можно брать локальные или через свой API. Ничего не уходит в облако.
10 загрузок с GitHubAudion Voice AI Studio
Содержание
- Зачем это сделано
- Что нужно доустановить
- Издания
- Принцип
- Что умеет
- Дальше
- Техническая часть
- FFmpeg и драйвер NVIDIA
- Портативность
Расшифровка записей, живая диктовка, чистка текста и выгрузка рабочих заметок. Расширенное издание — для рабочей станции с видеокартой NVIDIA.
Зачем это сделано
Расшифровка нужна в двух совершенно разных обстоятельствах.
Быстро и сейчас. Продиктовать абзац, расшифровать десятиминутную запись, получить текст сразу. Здесь важна скорость отклика, и облачная служба подходит лучше всего.
Много и без сети. Часовое совещание, диктофонная запись целого дня, папка файлов. Здесь важнее автономность: запись не должна уезжать наружу, а стоимость не должна расти с каждым часом.
Это издание делает упор на второе. На машине с видеокартой локальные движки перестают быть компромиссом: час записи считается за минуты, а сама запись не покидает компьютер.
Что нужно доустановить
Веса моделей в раздачу не входят — около 7 ГБ: кэш GigaAM, whisper.cpp с моделями Turbo и Large V2; вместе со слоем разделения по говорящим (только для NVIDIA) около 10,6 ГБ.
У весов свои лицензии, отдельные от лицензии программы, а условия разделения по говорящим принимаются лично, под своей учётной записью — поэтому скачивает их сам пользователь.
Пока модели не установлены, расшифровка не запустится: окно откроется, а распознавать будет нечем.
При первом запуске программа сама предложит докачать недостающее. Окно «Докачать модели и движки» перечисляет модули с объёмом загрузки: GigaAM, whisper.cpp CUDA с моделью Turbo, модель Large V2 и, на машине с NVIDIA, слой разделения по говорящим; вместе около 10,6 ГБ. Кнопка «Скачать и установить» ставит их по очереди; ход виден на странице «Обслуживание», и когда всё скачано, все режимы там горят зелёным. «Позже» откладывает вопрос до следующего запуска, «Больше не предлагать» скрывает окно навсегда. Модули по-прежнему ставятся вручную на той же странице.
Издания
| издание | для чего | движки |
|---|---|---|
| Live | ноутбук, повседневная работа | облачные службы, GigaAM, whisper.cpp |
| Studio | рабочая станция с видеокартой NVIDIA | то же плюс CUDA, разделение по говорящим |
Live остаётся основной версией для обычной работы. Studio добавляет ускоренные локальные движки, тяжёлые модели и разделение записи по говорящим.
Принцип
Сначала надёжное, потом красивое. Пакетная расшифровка работает предсказуемо, и на ней стоит всё остальное. Наложение поверх окон и мгновенный разбор на лету пробовались — и ломали работу самого окна. Тяжёлое не вешается на поток, который рисует интерфейс.
Что умеет
Расшифровка файлов и папок, живая диктовка, разделение записи по говорящим, чистка расшифрованного текста, выгрузка в рабочие заметки, значок в области уведомлений, сброс приложения к исходному состоянию.
Дальше
- Руководство — работа по шагам, движки, форматы.
Техническая часть
FFmpeg и драйвер NVIDIA
Каждая сборка FFmpeg собрана под конкретную версию заголовков аппаратного кодирования, и каждая требует своего минимума драйвера. Самая свежая сборка на старом драйвере не ускоряет, а ломает аппаратный путь — поэтому сборка подбирается по драйверу, а не по номеру версии.
Портативность
Состояние приложения лежит в папке проекта, а не в системе. Отдельная команда возвращает приложение к исходному состоянию, не трогая скачанные модели.
Программа портативная: распакованная папка и есть установленная программа. Реестр не трогается, удаление — удалить папку.
$name = "Audion_Voice_AI_Studio_v2.2.3_Full.zip"
Invoke-WebRequest "https://audion.dev/get/voice-ai-studio/2.2.3/Audion_Voice_AI_Studio_v2.2.3_Full.zip" -OutFile $name
Invoke-WebRequest "https://audion.dev/get/voice-ai-studio/2.2.3/Audion_Voice_AI_Studio_v2.2.3_Full.zip.sha256" -OutFile "$name.sha256"
$want = (Get-Content "$name.sha256").Split(" ")[0]
$have = (Get-FileHash $name -Algorithm SHA256).Hash.ToLower()
if ($want -ne $have) { throw "сумма не сошлась: загрузка повреждена" }
Expand-Archive $name -DestinationPath ".\voice-ai-studio"