# Audion Voice AI Studio

[English](README_EN.md) · [Руководство](USER_GUIDE_RU.md)

**Содержание**

- [Зачем это сделано](#зачем-это-сделано)
- [Что нужно доустановить](#что-нужно-доустановить)
- [Издания](#издания)
- [Принцип](#принцип)
- [Что умеет](#что-умеет)
- [Дальше](#дальше)
- [Техническая часть](#техническая-часть)
  - [FFmpeg и драйвер NVIDIA](#ffmpeg-и-драйвер-nvidia)
  - [Портативность](#портативность)

Расшифровка записей, живая диктовка, чистка текста и выгрузка рабочих заметок.
Расширенное издание — для рабочей станции с видеокартой NVIDIA.

## Зачем это сделано

Расшифровка нужна в двух совершенно разных обстоятельствах.

**Быстро и сейчас.** Продиктовать абзац, расшифровать десятиминутную запись,
получить текст сразу. Здесь важна скорость отклика, и облачная служба подходит
лучше всего.

**Много и без сети.** Часовое совещание, диктофонная запись целого дня, папка
файлов. Здесь важнее автономность: запись не должна уезжать наружу, а стоимость
не должна расти с каждым часом.

Это издание делает упор на второе. На машине с видеокартой локальные движки
перестают быть компромиссом: час записи считается за минуты, а сама запись не
покидает компьютер.

## Что нужно доустановить

**Веса моделей в раздачу не входят** — около 7 ГБ: кэш GigaAM, whisper.cpp с
моделями Turbo и Large V2; вместе со слоем разделения по говорящим (только для
NVIDIA) около 10,6 ГБ.

У весов свои лицензии, отдельные от лицензии программы, а условия разделения по
говорящим принимаются **лично, под своей учётной записью** — поэтому скачивает
их сам пользователь.

Пока модели не установлены, расшифровка не запустится: окно откроется, а
распознавать будет нечем.

**При первом запуске программа сама предложит докачать недостающее.** Окно
«Докачать модели и движки» перечисляет модули с объёмом загрузки: GigaAM,
whisper.cpp CUDA с моделью Turbo, модель Large V2 и, на машине с NVIDIA,
слой разделения по говорящим; вместе около 10,6 ГБ. Кнопка «Скачать и
установить» ставит их по очереди; ход виден на странице «Обслуживание», и когда
всё скачано, все режимы там горят зелёным. «Позже» откладывает вопрос до
следующего запуска, «Больше не предлагать» скрывает окно навсегда. Модули
по-прежнему ставятся вручную на той же странице.

## Издания

| издание | для чего | движки |
|---|---|---|
| Live | ноутбук, повседневная работа | облачные службы, GigaAM, whisper.cpp |
| **Studio** | рабочая станция с видеокартой NVIDIA | то же плюс CUDA, разделение по говорящим |

Live остаётся основной версией для обычной работы. Studio добавляет ускоренные
локальные движки, тяжёлые модели и разделение записи по говорящим.

## Принцип

**Сначала надёжное, потом красивое.** Пакетная расшифровка работает
предсказуемо, и на ней стоит всё остальное. Наложение поверх окон и мгновенный
разбор на лету пробовались — и ломали работу самого окна. Тяжёлое не вешается на
поток, который рисует интерфейс.

## Что умеет

Расшифровка файлов и папок, живая диктовка, разделение записи по говорящим,
чистка расшифрованного текста, выгрузка в рабочие заметки, значок в области
уведомлений, сброс приложения к исходному состоянию.

## Дальше

* [Руководство](USER_GUIDE_RU.md) — работа по шагам, движки, форматы.

---

## Техническая часть

### FFmpeg и драйвер NVIDIA

Каждая сборка FFmpeg собрана под конкретную версию заголовков аппаратного
кодирования, и каждая требует своего минимума драйвера. Самая свежая сборка на
старом драйвере не ускоряет, а ломает аппаратный путь — поэтому сборка
подбирается по драйверу, а не по номеру версии.

### Портативность

Состояние приложения лежит в папке проекта, а не в системе. Отдельная команда
возвращает приложение к исходному состоянию, не трогая скачанные модели.
