RU

Робот оглох и молчит об этом: как мы учили гуманоида замечать, что микрофон «отвалился»

Слышит ли вас робот прямо сейчас? А если микрофон «отвалился» — как быстро вы об этом узнаете? Штатный микрофон гуманоида Walker Tienkung предполага…

usb микрофонбеспроводной микрофонпетличкаalsaudevробототехникагуманоидголосовой интерфейсдиагностикараспознавание речи
Habr
RU

Провожу тест‑драйв GigaChat Audio в рабочих условиях

Привет, Хабр! Сбер недавно выкатил новую модель, GigaChat Audio. Сейчас я надиктовываю модели этот текст голосом — финальный штрих в истор…

тест-драйвии-модельgigachatтранскрибацияраспознавание речиавтоматизация рутинытранскрипция
Хабр — Управление
RU

Я сделал CRM без бэкенда. Вот чего мне это стоило

Приложение слушает разговоры продавца с клиентами и превращает их в текст. Человек на той стороне трубки не подписывался на то, чтобы его голос уеха…

whisper.cppon-deviceраспознавание речиlocal-firstприватностьAndroidGoogle Play
Habr
RU

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски? Мы решили проверить — и быстро выяснили, что ответ сложнее,…

распознавание речисинтез речиwhispersilerovoskголосовой ассистентробототехникагуманоидllmэмбеддинги
Habr
RU

Собеседовании для вас большой стресс? Для меня было да, поэтому создал решение

Есть неприятный момент на техническом собеседовании. Интервьюер заканчивает длинный вопрос, и ты понимаешь, что тема знакома. Ты делал это…

нейросетираспознавание речиперевод в реальном времениWindowsRustElectronLLMсобеседованиепоиск работыreal-time
Habr
RU

Почему голосовые ИИ‑агенты перебивают людей: замерил на боевом API и починил правилами русского синтаксиса

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской…

голосовые агентыраспознавание речиendpointingturn detectionVADзадержка ответаRealtime APIсинтез речиNLPPython
Habr
RU

Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch

Голосовой ввод для Windows за ~1 секунду | Полностью локально • CPU • Open Source Как заставить Whisper распознавать речь почти в 4 раза быстрее на…

WhisperWhisperTypefaster-whisperCTranslate2Speech-to-Textраспознавание речиWindowsPythonCPUOpen Source
Habr
RU

Я печатаю медленнее, чем думаю: локальная диктовка на Whisper для Windows, телефона и Telegram

Я диктую постоянно: сообщения, заметки, постановку задач — говорить в разы быстрее, чем печатать, а мысль не успевает остыть. Проблема в том, что уд…

whisperдиктовкараспознавание речиspeech-to-textself-hostedtelegram-ботлокальные нейросетиfaster-whisper
Habr
RU

Как сжать 300+ часов D&D сериала в пересказ для актеров

Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров з…

GigaAMWhisperASRраспознавание речидиаризацияClaudeOpusLLMбаза знанийтранскрибация
Habr
RU

Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки

В марте я советовал Whisper Large v3 для голосовой диктовки и ошибался дважды: в методе (выбирал модель «на ощупь») и в самой модели. Пересобрал всё…

whisperbreeze-asrраспознавание речиASRvoice-to-textwhisper large v3whisper turbogigaam v3faster whispercode-switching
Habr
RU

Как я собрал полностью локальную диктовку для русского языка на Mac: GigaAM, Whisper, Qwen и Apple

VoiceSwitch — открытое menu bar-приложение для Apple Silicon: одна глобальная клавиша запускает запись, GigaAM, Whisper, Qwen или Apple распознают р…

VoiceSwitchраспознавание речиGigaAMWhisperQwenMLXmacOSлокальные модели
Habr
RU

Распознаем речь из видео(аудио) в текст. Короткая инструкция по транскрибации для чайников

Всем привет, друзья!  Сегодня я расскажу, как быстро настроить распознавание речи(транскрибацию) из видео(аудио) в текст. Для этого воспользуем…

транскрибацияраспознавание речисубтитры
Habr
RU

Как устроены voice-2-voice модели

Речь входит — речь выходит. Что внутри voice-2-voice моделей: как нейронный кодек превращает звук в токены, почему каскад ASR → LLM → TTS проигрывае…

голосовые ассистентыvoice-to-voicespeech-to-speechраспознавание речисинтез речиLLMнейронные аудиокодекиOpenAI Realtime APIGemini Livemoshi
Habr
RU

Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записыв…

iOSраспознавание речиASRspeech-to-texton-device MLлокальные моделитранскрибацияSpeechAnalyzerApple Neural Engineразработка под iOS
Habr
RU

Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избра…

selectelраспознавание речиwhisperqwenasrтранскрибация речиавтоматическое распознавание речиискусственный интеллекттестирование моделей
Habr
RU

Как сделать свой сервис распознавания голоса вместо PLAUD и закрытых ИИ-диктофонов

Звук сегодня является важным интерфейсом. Работа с чат-ботом своей "ИИшечки" упрощается в разы. Кроме того, помимо вайб-кодинга - есть еще и обычная…

вайб-кодингвайбокодинграспознавание речиmarkdownobsidian
Habr
RU

Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса

Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и…

ASRраспознавание речикомпьютерное зрениеvadobject trackingвидеоаналитикаspeech recognitioncomputer vision
Habr
RU

Как мы превращаем звонок риэлтора в карточку лида за 15 секунд: ИИ-автолид изнутри

Риэлтор за рулём. Звонит собственник трёшки на Соколе: “Видел ваше объявление, хочу обсудить продажу”. Двадцать минут живого разговора - район, пере…

распознавание речиdeepgramllmspeech-to-textcrmавтоматизацияпайплайннедвижимость
Habr
RU

Голосовой КПТ-дневник с распознаванием речи на устройстве: Flutter и on-device Whisper

Эта статья про то, как я сделал голосовой дневник мыслей для когнитивно-поведенческой терапии, почему распознавание речи у меня крутится прямо на те…

FlutterWhisperwhisper.cppon-deviceраспознавание речиDartКПТмобильная разработка
Habr
RU

Почему WER недостаточно: Семантическая декомпозиция ошибок ASR

В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет н…

werasrnernlpречевые технологиираспознавание речиwhisperмашинное обучениеОценка качества моделейречь в текст
Habr
RU

Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы

Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что под…

распознавание речиASRWhisperGigaAMWERfaster-whisperбенчмаркfine-tuningрусский ASRоффлайн-распознавание
Habr
RU

Видео → текст → саммари. Ставим транскрибацию на Mac

Транскрибируем любое видео локально, прямо на Mac. Бесплатно, приватно, с качеством на уровне платных сервисов. Полный гайд: настройка, скрипт и про…

whisper.cppтранскрибацияmacOSраспознавание речилокальный ИИвидео в текстsubtitlesvoice activity detection
Habr
RU

От папки с созвонами до 5K+ юзеров: как pet-проект «для себя» встретился с реальными пользователями

Записать созвон — легко. Сложнее потом найти, где именно обсуждали сроки, бюджет и того самого человека, которого нужно было добавить в копию письма…

распознавание речиpet-проектыразработка продуктаUXстартапыличный опыт.запись экранаии
Habr
RU

Голос в текст, текст в перевод: строим десктопное приложение для распознавания речи с Azure Speech SDK и NAudio

Голос в текст, текст в перевод: строим десктопное приложение для распознавания речи с Azure Speech SDK и NAudio Читать далее

.netc#avaloniauiazure speech servicesnaudioreactiveuiтранскрибациядиаризацияраспознавание речи
Habr
RU

Веселимся со Spring: pet-проект по распознаванию речи

Не писал на Spring уже лет 8 и решил по фану написать мини пет проект с api и распознаванием речи. Звучит круто, лет 8-10 назад это заняло бы … вечн…

JavaSpring FrameworkVoskspeech recognitionраспознавание речиREST APIWAVJava Sound APIpet projectвеселье