Voice AI Live
github.com/Tensionix/voice-ai-live ↗
Можно не платить за Wispr Flow: диктовка идёт на своей машине, а модели выбираете сами — локальные или через свой API. Есть рекордер аудио, действия вызываются из трея и оверлея, не отрывая рук от текста. Лёгкая сборка: модели докачиваются отдельно, поэтому она не весит гигабайты.
12 загрузок с GitHubAudion Voice AI Live
Содержание
- Зачем это сделано
- Что нужно доустановить
- Издания
- Принцип
- Что умеет
- Дальше
- Техническая часть
- FFmpeg и драйвер NVIDIA
- Портативность
Расшифровка записей, живая диктовка, чистка текста и выгрузка рабочих заметок. Лёгкое издание — для ноутбука и повседневной работы.
Зачем это сделано
Расшифровка нужна в двух совершенно разных обстоятельствах.
Быстро и сейчас. Продиктовать абзац, расшифровать десятиминутную запись, получить текст сразу. Здесь важна скорость отклика, и облачная служба подходит лучше всего.
Много и без сети. Часовое совещание, диктофонная запись целого дня, папка файлов. Здесь важнее автономность: запись не должна уезжать наружу, а стоимость не должна расти с каждым часом.
Программа умеет оба, и переключение между ними — вопрос выбора движка, а не другой программы.
Что нужно доустановить
Веса моделей в раздачу не входят — вместе они занимают около 3,3 ГБ. У весов свои лицензии, отдельные от лицензии программы, поэтому их скачивает сам пользователь, под своей учётной записью там, где это требуется.
Пока модели не установлены, расшифровка не запустится: окно откроется, а распознавать будет нечем.
При первом запуске программа сама предложит докачать недостающее. Окно «Докачать модели и движки» перечисляет модули с объёмом загрузки — для Live это GigaAM и whisper.cpp с моделью Turbo, около 3,3 ГБ. Кнопка «Скачать и установить» ставит их по очереди; ход виден на странице «Обслуживание», и когда всё скачано, все режимы там горят зелёным. «Позже» откладывает вопрос до следующего запуска, «Больше не предлагать» скрывает окно навсегда — модули по-прежнему ставятся вручную на той же странице.
Издания
| издание | для чего | движки |
|---|---|---|
| Live | ноутбук, повседневная работа | облачные службы, GigaAM, whisper.cpp |
| Studio | рабочая станция с видеокартой NVIDIA | то же плюс CUDA, разделение по говорящим |
Live — основная версия. Studio добавляет тяжёлые локальные движки и разделение записи по говорящим для машин, где есть чем это считать.
Принцип
Сначала надёжное, потом красивое. Пакетная расшифровка работает предсказуемо, и на ней стоит всё остальное. Наложение поверх окон и мгновенный разбор на лету пробовались — и ломали работу самого окна. Тяжёлое не вешается на поток, который рисует интерфейс.
Что умеет
Расшифровка файлов и папок, живая диктовка, чистка расшифрованного текста, выгрузка в рабочие заметки, значок в области уведомлений для быстрого доступа, сброс приложения к исходному состоянию.
Дальше
- Руководство — работа по шагам, движки, форматы.
Техническая часть
FFmpeg и драйвер NVIDIA
Каждая сборка FFmpeg собрана под конкретную версию заголовков аппаратного кодирования, и каждая требует своего минимума драйвера. Самая свежая сборка на старом драйвере не ускоряет, а ломает аппаратный путь — поэтому сборка подбирается по драйверу, а не по номеру версии.
Портативность
Состояние приложения лежит в папке проекта, а не в системе. Отдельная команда возвращает приложение к исходному состоянию, не трогая скачанные модели.
Программа портативная: распакованная папка и есть установленная программа. Реестр не трогается, удаление — удалить папку.
$name = "Audion_Voice_AI_Live_v2.2.3_Full.zip"
Invoke-WebRequest "https://audion.dev/get/voice-ai-live/2.2.3/Audion_Voice_AI_Live_v2.2.3_Full.zip" -OutFile $name
Invoke-WebRequest "https://audion.dev/get/voice-ai-live/2.2.3/Audion_Voice_AI_Live_v2.2.3_Full.zip.sha256" -OutFile "$name.sha256"
$want = (Get-Content "$name.sha256").Split(" ")[0]
$have = (Get-FileHash $name -Algorithm SHA256).Hash.ToLower()
if ($want -ne $have) { throw "сумма не сошлась: загрузка повреждена" }
Expand-Archive $name -DestinationPath ".\voice-ai-live"