🎙 Voice input для програмування - це, здається, одна з тих дрібних штук, після яких вже трохи не хочеться повертатися назад 🙂
На одному з останніх стрімів я показував, як працюю з AI-агентом у Claude Code CLI. І там був момент, де я не друкував prompt руками, а просто натиснув клавішу, сказав голосом англійською, воно розпізнало текст, я натиснув Enter - і агент пішов працювати.
І я тоді ще сказав щось типу: “ну отак я зараз часто і програмую” 😁
У Claude Code це вже вбудована функція. Вмикається через /voice, потім можна просто тримати Space, диктувати текст, відпускати - і воно вставляє розпізнаний текст у prompt. Зручно для довгих пояснень, коли треба не “напиши мені метод”, а нормально описати контекст, що саме треба зробити, які є обмеження, що вже пробував, де болить і т.п.
Є нюанс: у Claude Code це не локальне розпізнавання. Аудіо відправляється на сторону Anthropic для speech-to-text. І, можливо, це і ОК, адже все одно промпт ви друкуєте та відправляєте. Але все одно це варто розуміти.
Я ще на стрімі показував OpenCode. Наскільки я зараз бачу, в самому OpenCode нативного voice input у документації немає. Є сторонні рішення, які намагаються це додати, але я б не називав це вбудованою фічею OpenCode.
Але якщо хочеться voice input не тільки в Claude Code, а взагалі будь-де - в терміналі, браузері, редакторі, та хоч у Telegram - є дуже приємна штука:
https://handy.computer
Handy - це open-source speech-to-text апка для Windows, macOS і Linux. Вона вішає глобальний shortcut: натиснув, сказав, відпустив - і текст вставився в активне поле. Тобто для програм, які самі не підтримують voice input, воно все одно працює.
І головне: Handy робить розпізнавання локально. Тобто голос нікуди не летить в інтернет. У нього є різні моделі - якісь швидші, якісь точніші, якісь краще підтримують різні мови. У мене з мультимовністю не все ідеально запрацювало, але, можливо, у когось з вас буде краще - цікаво буде почути.
Мені дуже подобається такий формат роботи: не сидіти і мучити клавіатуру, а просто подумати голосом, навалити великий prompt, потім трохи підправити руками - і відправити агенту.
Особливо коли працюєш з AI-агентами, де якість результату дуже залежить від того, наскільки нормально ти пояснив задачу. Голосом це часто виходить швидше і природніше, ніж руками.
Звісно, схожий voice input є і в ChatGPT web/mobile, і в Gemini, і в системних диктовках macOS/Windows. Але Handy мені подобається саме тим, що воно працює майже всюди і локально.
Коротше, якщо ви вже пробуєте Claude Code, OpenCode або інші AI coding agents - дуже рекомендую спробувати voice input. Це одна з тих маленьких змін у workflow, які раптово дуже сильно міняють відчуття від роботи.