- BrainTools - https://www.braintools.ru -

Готовит ли OpenAI новую революцию в IT?

Готовит ли OpenAI новую революцию в IT? - 1

Некоторое время назад появилась новость, что Сэм Альтман и Джонни Айв начали совместный проект. Тогда практически ничего не сообщалось о том, что именно они собираются делать. Говорилось лишь о том, что речь идет не о программном обеспечении, а о каком-то новом устройстве.

И вот недавно появились подробности, что этим устройством станет нечто вроде умной колонки. Честно говоря, сначала это разочаровало. Рынок умных колонок уже давно существует. Есть Amazon Echo, Apple HomePod, Яндекс Алиса и др. Казалось бы, зачем делать еще одну? В этом инсайде есть и еще одна деталь, а именно: устройство будет ориентировано прежде всего на голосовое взаимодействие. Но здесь снова возникает вопрос – а в чем собственно новизна? Ведь все умные колонки и так управляются голосом.

Но тут же, параллельно, OpenAI выпускает Voice Mode в ChatGPT. Причем, это уже не просто диктовка текста. Разница между обычной диктовкой и Voice Mode очень даже существенная. При диктовке ты говоришь, заканчиваешь фразу, ждешь распознавания, исправляешь ошибки [1], отправляешь сообщение. Voice Mode работает гораздо круче. Голосовой ассистент слушает постоянно, реагирует практически мгновенно, без пауз, поддерживая таким образом естественный темп разговора. Может даже говорить одновременно с пользователем. Через пару-тройку фраз перестаешь воспринимать происходящее как работу с программой. Возникает ощущение разговора с человеком.

Кому идти на выход?

Первая волна отзывов о Voice Mode пошла о том, как удобно использовать этот режим в качестве репетитора для изучения иностранного языка. Я тоже попробовал и провалил первый же разговор, потому как ожидал действительно какого-то репетиторства с короткими, медленными и идеально проговариваемыми фразами и не был готов к быстрому и насыщенному диалогу. Но вот другой эксперимент с использованием Voice Mode от ChatGPT в качестве переводчика прошел очень даже удачно. Так что когда нам говорят, что ИИ заменит программистов, то стоит, наверное, посмотреть и в другие стороны. Не знаю как с репетиторами, думаю они еще будут нужны. А вот переводчикам, похоже, пора готовить запасные аэродромы.

И если посмотреть на эти новости вместе и в перспективе, то практически неизбежно приходишь к выводу о том, что OpenAI действительно готовит следующую революцию в ИТ!

А именно: в истории развития вычислительной техники есть важные вехи, связанные с устройствами для ввода информации. Сначала перфокарты, потом клавиатура, затем мышь, и наконец сенсорный экран.

И теперь мы можем предположить, что OpenAI задумала использовать для ввода информации новое устройство – голос человека.

С этой точки зрения [2] создание умной колонки уже не выглядит банальностью, если под такой колонкой понимать не просто девайс, который распознает голосовые команды, а полноценный компьютер, но уже без клавиатуры и без мышки. И главным средством управления этим компьютером станет именно голос человека.

Именно такой поворот, как написал бы ИИ )), кардинально меняет ситуацию.

Об этом может свидетельствовать и следующее интересное наблюдение. Во всех предыдущих случаях пользователю нужно было научиться пользоваться устройством ввода – освоить клавиатуру, мышку, сенсорный экран. А вот в случае с голосом учиться уже будет больше ИИ: распознавать голос человека, понимать о чем он говорит, удерживать в памяти [3] и т.д. Т.е., происходит действительно кардинальная смена пользовательского интерфейса и способов взаимодействия пользователя с компьютером.

Можно пойти еще дальше в этом футуристическом прогнозе. А именно: мы по привычке говорим о голосе как о новом интерфейсе. Но, возможно, что голос — это только первый шаг и что настоящий интерфейс будущего — это естественное человеческое общение.

Предположим, что завтра оно будет происходить голосом. А послезавтра к нему добавятся камера, взгляд, жесты, понимание окружающей обстановки, память о предыдущих разговорах и знание контекста. Компьютер будет воспринимать ситуацию сразу через несколько каналов, также как это делает человек.

Т.е., голос окажется не целью, а первым и самым естественным способом начать этот переход.

Дань уважения Siri

Здесь стоит вспомнить Siri. Сегодня принято над ней посмеиваться. Однако именно Siri первой показала миллионам людей способ разговора с компьютером голосом. Даже во многих фильмах стали показывать очень удобный способ, когда человек голосом дает задание Siri позвонить кому-то из своих контактов. Современные большие языковые модели, конечно, ушли довольно далеко вперед. Они уже понимают смысл сказанного, удерживают контекст разговора, задают уточняющие вопросы и способны поддерживать диалог.

Если эта гипотеза окажется верной, то лет через сколько-то клавиатура может восприниматься примерно так же, как сегодня воспринимается командная строка: хороший инструмент для специалистов, но уже не основной способ общения большинства людей с компьютером.

Из всего сказанного напрашивается вполне практический вывод: следующая большая волна для стартапов — голосовые интерфейсы. И есть реальные основания полагать, что это направление станет самым перспективным в ближайшее время.

Автор: AppCrafter

Источник [4]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/33521

URLs in this post:

[1] ошибки: http://www.braintools.ru/article/4192

[2] зрения: http://www.braintools.ru/article/6238

[3] памяти: http://www.braintools.ru/article/4140

[4] Источник: https://habr.com/ru/articles/1062852/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1062852

www.BrainTools.ru

Rambler's Top100