AudionAudion

Audion Voice AI Studio

README_RU.md

Audion Voice AI Studio

English · Руководство

Содержание

Расшифровка записей, живая диктовка, чистка текста и выгрузка рабочих заметок. Расширенное издание — для рабочей станции с видеокартой NVIDIA.

Зачем это сделано

Расшифровка нужна в двух совершенно разных обстоятельствах.

Быстро и сейчас. Продиктовать абзац, расшифровать десятиминутную запись, получить текст сразу. Здесь важна скорость отклика, и облачная служба подходит лучше всего.

Много и без сети. Часовое совещание, диктофонная запись целого дня, папка файлов. Здесь важнее автономность: запись не должна уезжать наружу, а стоимость не должна расти с каждым часом.

Это издание делает упор на второе. На машине с видеокартой локальные движки перестают быть компромиссом: час записи считается за минуты, а сама запись не покидает компьютер.

Что нужно доустановить

Веса моделей в раздачу не входят — около 7 ГБ: кэш GigaAM, whisper.cpp с моделями Turbo и Large V2; вместе со слоем разделения по говорящим (только для NVIDIA) около 10,6 ГБ.

У весов свои лицензии, отдельные от лицензии программы, а условия разделения по говорящим принимаются лично, под своей учётной записью — поэтому скачивает их сам пользователь.

Пока модели не установлены, расшифровка не запустится: окно откроется, а распознавать будет нечем.

При первом запуске программа сама предложит докачать недостающее. Окно «Докачать модели и движки» перечисляет модули с объёмом загрузки: GigaAM, whisper.cpp CUDA с моделью Turbo, модель Large V2 и, на машине с NVIDIA, слой разделения по говорящим; вместе около 10,6 ГБ. Кнопка «Скачать и установить» ставит их по очереди; ход виден на странице «Обслуживание», и когда всё скачано, все режимы там горят зелёным. «Позже» откладывает вопрос до следующего запуска, «Больше не предлагать» скрывает окно навсегда. Модули по-прежнему ставятся вручную на той же странице.

Издания

изданиедля чегодвижки
Liveноутбук, повседневная работаоблачные службы, GigaAM, whisper.cpp
Studioрабочая станция с видеокартой NVIDIAто же плюс CUDA, разделение по говорящим

Live остаётся основной версией для обычной работы. Studio добавляет ускоренные локальные движки, тяжёлые модели и разделение записи по говорящим.

Принцип

Сначала надёжное, потом красивое. Пакетная расшифровка работает предсказуемо, и на ней стоит всё остальное. Наложение поверх окон и мгновенный разбор на лету пробовались — и ломали работу самого окна. Тяжёлое не вешается на поток, который рисует интерфейс.

Что умеет

Расшифровка файлов и папок, живая диктовка, разделение записи по говорящим, чистка расшифрованного текста, выгрузка в рабочие заметки, значок в области уведомлений, сброс приложения к исходному состоянию.

Дальше


Техническая часть

FFmpeg и драйвер NVIDIA

Каждая сборка FFmpeg собрана под конкретную версию заголовков аппаратного кодирования, и каждая требует своего минимума драйвера. Самая свежая сборка на старом драйвере не ускоряет, а ломает аппаратный путь — поэтому сборка подбирается по драйверу, а не по номеру версии.

Портативность

Состояние приложения лежит в папке проекта, а не в системе. Отдельная команда возвращает приложение к исходному состоянию, не трогая скачанные модели.

Все проекты