Робот оглох и молчит об этом: как мы учили гуманоида замечать, что микрофон «отвалился»
Слышит ли вас робот прямо сейчас? А если микрофон «отвалился» — как быстро вы об этом узнаете? Штатный микрофон гуманоида Walker Tienkung предполага…
Tech news from the best sources
Слышит ли вас робот прямо сейчас? А если микрофон «отвалился» — как быстро вы об этом узнаете? Штатный микрофон гуманоида Walker Tienkung предполага…
Привет, Хабр! Сбер недавно выкатил новую модель, GigaChat Audio. Сейчас я надиктовываю модели этот текст голосом — финальный штрих в истор…
Приложение слушает разговоры продавца с клиентами и превращает их в текст. Человек на той стороне трубки не подписывался на то, чтобы его голос уеха…
Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски? Мы решили проверить — и быстро выяснили, что ответ сложнее,…
Есть неприятный момент на техническом собеседовании. Интервьюер заканчивает длинный вопрос, и ты понимаешь, что тема знакома. Ты делал это…
Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской…
Голосовой ввод для Windows за ~1 секунду | Полностью локально • CPU • Open Source Как заставить Whisper распознавать речь почти в 4 раза быстрее на…
Я диктую постоянно: сообщения, заметки, постановку задач — говорить в разы быстрее, чем печатать, а мысль не успевает остыть. Проблема в том, что уд…
Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров з…
В марте я советовал Whisper Large v3 для голосовой диктовки и ошибался дважды: в методе (выбирал модель «на ощупь») и в самой модели. Пересобрал всё…
VoiceSwitch — открытое menu bar-приложение для Apple Silicon: одна глобальная клавиша запускает запись, GigaAM, Whisper, Qwen или Apple распознают р…
Всем привет, друзья! Сегодня я расскажу, как быстро настроить распознавание речи(транскрибацию) из видео(аудио) в текст. Для этого воспользуем…
Речь входит — речь выходит. Что внутри voice-2-voice моделей: как нейронный кодек превращает звук в токены, почему каскад ASR → LLM → TTS проигрывае…
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записыв…
Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избра…
Система продуктивности Один большой текстовый файл OBTF - исследуем какие фишечки можно навесить концепцию в эпоху ИИ. Читать далее
Звук сегодня является важным интерфейсом. Работа с чат-ботом своей "ИИшечки" упрощается в разы. Кроме того, помимо вайб-кодинга - есть еще и обычная…
Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и…
Риэлтор за рулём. Звонит собственник трёшки на Соколе: “Видел ваше объявление, хочу обсудить продажу”. Двадцать минут живого разговора - район, пере…
Эта статья про то, как я сделал голосовой дневник мыслей для когнитивно-поведенческой терапии, почему распознавание речи у меня крутится прямо на те…
В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет н…
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что под…
Транскрибируем любое видео локально, прямо на Mac. Бесплатно, приватно, с качеством на уровне платных сервисов. Полный гайд: настройка, скрипт и про…
Записать созвон — легко. Сложнее потом найти, где именно обсуждали сроки, бюджет и того самого человека, которого нужно было добавить в копию письма…
Голос в текст, текст в перевод: строим десктопное приложение для распознавания речи с Azure Speech SDK и NAudio Читать далее
Не писал на Spring уже лет 8 и решил по фану написать мини пет проект с api и распознаванием речи. Звучит круто, лет 8-10 назад это заняло бы … вечн…