Представьте, что вы входите в open space в разгар рабочей недели, видите людей за столами — и практически ничего не слышите. Даже стаккато пальцев по клавиатуре.
Typing increasingly seems like it could become a thing of the past Subtle
Похоже, именно так может выглядеть будущее работы — во всяком случае, той её части, что проходит перед экраном компьютера. О том, как ИИ переворачивает продуктивность, за последние пару лет сказано немало: технология обещает ускорить рабочие процессы и продвинуть исследования в самых разных областях. Но меняется и буквальный способ работы — то, что мы делаем, сидя за столом.
ИИ всё чаще позволяет отложить клавиатуру и просто продиктовать, что нужно сделать: от отправки письма до наброска презентации и написания небольших приложений по описанию.
Инструменты диктовки существуют десятилетиями и давно стали товаром массовым — бесплатный вариант встроен в экранную клавиатуру любого смартфона. Но за последние пару лет они стали особенно хороши благодаря широко доступным моделям машинного обучения для распознавания речи и множеству компаний, строящих поверх них свои приложения. Итог: появился целый ряд программ преобразования речи в текст, которые шокирующе хорошо справляются с задачей — настолько, что ими реально пользоваться в работе, получая высокую точность и скорость.
Сегодня можно взять открытое приложение вроде Handy, которое запускает модель полностью локально на вашем компьютере: речь никогда не уходит в облако, а данные остаются при вас. Либо выбрать сервис вроде Wispr Flow, использующий более крупные модели, чтобы вычищать «эканье», оговорки и запинки, — на выходе получается текст, требующий меньше ручной правки.
Apps like Wispr Flow transcribe your speech in real time, and can even clean up your dictation Wispr
Разница в бизнес-моделях показательна. Handy активируется горячей клавишей и не ограничивает использование, оставаясь бесплатным. Wispr Flow, напротив, нацелен на корпоративный рынок и продаёт компаниям сервис диктовки и ведения заметок; стоящая за ним фирма только что привлекла раунд на 280 миллионов долларов при оценке в 2 миллиарда.
Интересное происходит и на аппаратной стороне. С января санфранцисский стартап Subtle продаёт наушники VoiceBuds за 250 долларов: выглядят они как обычные беспроводные затычки, но вместе с облачным сервисом компании улавливают вашу речь, даже если вы говорите в людном месте поверх чужих разговоров или тихо шепчете, чтобы вас не подслушали.
Любопытно, что, по словам разработчиков, дело не в дорогих микрофонах: всю работу по вычленению речи из фонового шума делает ИИ в реальном времени. Компания утверждает, что в шумной обстановке её наушники дают до пяти раз меньше ошибок расшифровки, чем связка AirPods Pro 3 с моделью транскрибации от OpenAI.
Конкуренция здесь появится очень скоро — просто потому, что желающих работать через наушники вместо клавиатуры будет больше. И причина не только в том, что кто-то не любит или не умеет быстро печатать: стремительно расширяется сам круг задач, которые решаются одной произнесённой командой.
Иначе говоря, голос становится всё более мощным способом ввода. Базовое железо для него уже есть почти у каждого, а сервисы, которые проясняют сказанное, достраивают смысл по контексту и выполняют действия, развиваются прямо сейчас. Отдельно стоит держать в голове две практические оговорки: для языков СНГ качество распознавания у локальных моделей заметно ниже, чем для английского, а облачная диктовка означает, что ваша речь — включая случайно попавшую в кадр конфиденциальную информацию — обрабатывается на чужих серверах.
Сейчас это выглядит странно, но шептать что-то нежное своему устройству в офисе, вполне возможно, скоро войдёт в привычку.















