Интерфейс покинул здание

Как чат, голос и агентный ИИ меняют основы UX-дизайна

Примечание: хоть автор и использовал ИИ-инструменты, чтобы отшлифовать грамматику и формулировки в этой статье, но все идеи, аргументы и примеры подкреплены семилетним опытом в проектирования ИИ-продуктов, создании агентных ритейл-сценариев в Walmart и патенте США на интерфейсы рекомендаций на основе намерения. ИИ помогал с редактурой, а не с генерацией смысла.

Палец человека указывает на светящийся, фрагментированный цифровой интерфейс — метафора перехода от физических экранов к амбиентным и разговорным поверхностям вычислений
Сгенерировано автором с помощью ИИ

Есть вопрос к которому я снова и снова возвращаюсь, глядя на то, что выходит в 2026 году: что именно мы вообще проектируем?

Тридцать лет ответ был очевиден. Мы проектировали экраны. Меню, модалки, кнопки, карусели. Организовывали информацию в иерархии, рисовали переходы между состояниями и зацикливались на пикселях. Метафора рабочего стола — окна, папки, файлы — дала общий словарь, и на нём выросла целая дисциплина.

Этот словарь сейчас разваливается.

Не исчезает. Разваливается, раскалываясь на несколько новых диалектов, которые почти не похожи друг на друга.

Сегодня пользователи взаимодействуют с софтом, разговаривая с ним, делегируя ему задачи и всё чаще вообще не взаимодействуя — потому что система уже всё сделала в фоне. Экран ещё на месте, но он больше не главная поверхность. Сам форм-фактор — фундаментальный договор между человеком и продуктом — в движении.

Это не трендовый текст про тёмную тему или скруглённые углы. Речь о чём-то более структурном: о трёх новых парадигмах взаимодействия, которые прямо сейчас переопределяют, что значит UX-дизайн — на реальных продуктах реальных компаний.

Акт I: Парадигма чата — когда интерфейс становится разговором

Первый сдвиг произошёл так быстро, что мы почти не заметили: это была проблема дизайна.

В 2022 году большинство людей никогда не общались с интерфейсами продуктов на естественном языке. К 2025-му 73% компаний использовали ту или иную форму разговорного интерфейса для общения с клиентами.

Поле ввода сообщения стало самым посещаемым элементом UI в мире.

Но ранние реализации показали кое-что важное: чат сам по себе — не хороший UX. Это модальность. И как любая модальность, для одних задач она блестяща, для других — катастрофична.

Это различие Эрика Холл проводит очень точно в Conversational Design (A Book Apart, 2018) — пожалуй, самой меткой книге на эту тему. Холл утверждает, что обмен сообщениями — правильный дизайн-паттерн только тогда, когда системе нужно согласовать смысл с пользователем. Когда пользователь уже знает, чего хочет — «добавить в корзину», «отфильтровать по цене», «отправить форму» — разговор — это лишние накладные расходы. Структура быстрее, точнее и меньше утомляет. Разговор оправдан только когда намерение неоднозначно: когда человек исследует, когда цель размыта, когда системе нужно встретить его на полпути.

Этот фреймворк меняет то, как вы оцениваете реализацию чата в реальной жизни. Продукты, которые поняли это раньше остальных, не ставили всё на чат. Они строили гибридные интерфейсы: структурированный UI для известных, предсказуемых задач; разговорный ИИ — для открытых, исследовательских.

AI-сайдбар Notion сидит рядом с документом и не подменяет его. Палитра команд в Linear берёт на себя тикет, который вы уже знаете, что хотите создать, а ИИ-слой помогает с неоднозначными вопросами, вроде «что блокирует мобильную команду?».

GitHub Copilot не сносит ваш IDE и не заменяет его чатом — он шепчет подсказки прямо в среде, в которой вы и так живёте.

Сравнение бок о бок: слева традиционная структурированная форма в Jira, справа разговорный ИИ-интерфейс в Linear — одна и та же задача решается GUI или чатом в зависимости от того, известно ли намерение пользователя или оно неоднозначно
Схема автора. Скриншоты интерфейсов: Jira © Atlassian · Linear © Linear Anywhere, Inc.

Здесь важно держать границу. В индустрии складывается простая формула: структурированный GUI — когда намерение пользователя известно; разговор — когда намерение неоднозначно.

Ошибка ранних чатботов — и некоторых продуктов до сих пор — в том, что чат воспринимали как универсальный растворитель. Это не так.

Это конкретный инструмент для конкретного состояния знания: когда пользователь ещё не знает точно, чего хочет, или не может легко выразить это кликами и формами.

Тот же принцип заложен в моём патенте на многоуровневые системы рекомендаций на основе намерения: он разделяет микро-намерение (высокая уверенность, запросы в той же категории) и макро-намерение (исследовательские, межкатегорийные цели), чтобы выбрать режим взаимодействия. Рамка Холл и этот патент описывают одну и ту же истину с разных точек зрения: ясность намерения должна определять режим интерфейса, а не наоборот.

Скриншот Perplexity AI: система генерирует целевую страницу ответа на шопинг-запрос — прозаические саммари, цитаты источников и уточняющие вопросы, собранные динамически вокруг намерения пользователя
Скриншот: Perplexity.ai, личный скриншот, 2026

Perplexity это понял. Вместо «лучшего поискового поля» они построили систему, которая генерирует страницы ответов под конкретную задачу — прозаические саммари, цитаты источников, уточняющие вопросы, структурированные данные — собираемые в реальном времени вокруг того, что вы пытаетесь понять.

Исследователи назвали этот паттерн «Generative UI»: вместо навигации по приложению вы выражаете желание, и интерфейс собирает себя, чтобы обслужить именно эту потребность.

Для UX это меняет многое. Если интерфейс можно генерировать динамически, задача дизайнера — уже не спроектировать каждое состояние, а спроектировать систему, которая порождает уместные состояния. Вы пишете правила грамматики, а не предложения.

Меняются и ремесленные вопросы. Стриминг ответов (текст появляется слово за словом, будто кто-то печатает) оказывается сильным сигналом доверия — пользователи чувствуют, что система работает, а не зависла. Видимая кнопка остановки во время генерации даёт ощущение контроля над тем, что иначе кажется непрозрачным. Цитаты источников с кликабельными ссылками превращают чатбота из оракула в помощника. Это решения на уровне микроинтеракций с крупными последствиями для доверия и внедрения.

Акт II: Голосовая парадигма — ухо как новый экран

Уже целое десятилетие голосовые интерфейсы много обещают, но не оправдывают ожиданий. Эпоха «умных» колонок научила нас, что “ambient computing” звучит прекрасно в пресс-релизах, но вызывает разочарование на кухне.

Но в конце 2025-го что-то сдвинулось — и с неожиданной стороны: от уха.

Анонс Apple про Siri AI в июне 2026 — самый ясный сигнал, куда всё идёт. Новая Siri — не голосовой ассистент, прикрученный к телефону. Это кросс-девайсный разговорный слой: начинаете вопрос на iPhone, продолжаете на iPad, и разговор живёт дальше. У неё есть понимание содержимого экрана (она видит, на что вы смотрите), понимание личного контекста (письма, календарь, фото) и самая мощная модель на устройстве, которую Apple когда-либо выпускала, с приватным локальным выводом для чувствительных запросов. Apple строит AirPods как основной интерфейс, а не как аксессуар.

Чтобы понять, почему это важно, полезно понять, почему предыдущее поколение провалилось. Исследования Клиффорда Насса и Скотта Брейва в Wired for Speech (MIT Press, 2005) показали контринтуитивную вещь: люди нейрологически предрасположены воспринимать голос как социальный канал, а не как канал команд. Когда мы слышим речь, в мозге активируются схемы социального познания — мы ожидаем взаимности, контекста, взаимоотношений. Старая модель Siri была транзакционной: отдаёшь команду, получаешь результат, взаимодействие завершено. Это нарушало «контракт на общение», которого наш мозг ожидает от голоса. Новая модель носит реляционный характер — она сохраняет контекст на протяжении всего разговора, на разных устройствах и во времени. Это не просто обновление функционала. Это смена парадигмы, которую исследования Насса и Брейва предсказали ещё двадцать лет назад.

Провальные кейсы поучительны именно потому, что подтверждают тот же принцип. Humane AI Pin — ставка в $240M на носимое устройство без экрана с голосом в центре — вышел в апреле 2024 за $699 и был свёрнут меньше чем через год. Кэти Перл, чей Designing Voice User Interfaces (O'Reilly, 2016) до сих пор самый практичный гид по этой области, выделила задержку и восстановление после ошибок как две переменные, от которых зависит, будет ли голосовой интерфейс восприниматься как надежный или неработающий.

У Pin время отклика на стандартные запросы составляло от двух до пяти секунд — при том, что в данной сфере две секунды кажутся вечностью. Кроме того, у него отсутствовал постоянный контекст: каждое взаимодействие было безсостоятельным, а это означало, что оно не выдерживало самого элементарного теста на полезность разговора. Диагностика Перла, написанная за десятилетие до появления Pin на рынке, точно описывает его неудачу.

Фото: человек с маленьким белым трекером на куртке, белыми беспроводными наушниками и смартфоном с голосовым интерфейсом поверх изображения бейсбола. Подпись напоминает урок за $240 миллионов: голосовой опыт держится на латентности и контексте, а не на железе
Коллаж автора. Humane AI Pin © Humane, Inc. · AirPods © Apple Inc.

Rabbit R1 споткнулся по тем же причинам на старте, а потом встал на ноги с обновлением RabbitOS 2 в конце 2025 — не потому что изменилось железо, а потому что софт наконец уважал контракт взаимодействия, которого требует голос.

Урок обоих устройств для индустрии: голосовой UX абсолютно не терпит задержек и потерю контекста. В отличие от экрана, где можно осмотреться и сориентироваться, у голоса нет пространственной памяти. Если система потеряла нить, визуального якоря для восстановления нет. Значит, инфраструктурные требования — время ответа, удержание контекста, изящное восстановление после ошибок — для голоса существенно выше, чем для любого визуального интерфейса.

Пространственный звук становится слоем обратной связи. AirPods от Apple используют анализ аудиосцены в реальном времени, чтобы отличать сигнал от шума, — и открывают дизайн-пространство, где сам звук становится UI обратной связи. Тактильные импульсы на носимых устройствах подтверждают выполнение действий без использования экрана. Это новые элементы дизайна, для описания которых у большинства специалистов в этой области пока нет подходящих терминов — ведь до сих пор их просто не было в арсенале инструментов.

Парадигма голосового управления — не про «разговор с телефоном». Она про проектирование взаимодействий, которые происходят, пока вы занимаетесь чем-то другим — готовите, гуляете, водите машину — когда ваше внимание распределено, а контекст воплощен в действиях. Это принципиально иная дизайнерская задача, чем та, к которой готовит вас ментальная модель, основанная на использовании экрана.

Акт III: Агентная парадигма — когда интерфейс действует за вас

Самым радикальным изменением форм-фактора является не чат и не голосовое взаимодействие. Это тот случай, когда интерфейс полностью исчезает, поскольку искусственный интеллект уже взял все на себя.

Агентный ИИ — системы, которые не просто отвечают на запросы, но и выполняют последовательности действий, используют инструменты, просматривают веб-страницы, пишут код, отправляют электронные письма, заполняют формы — превратился из исследовательской демонстрационной версии в серийный продукт в период с 2024 по 2025 год. Operator от OpenAI может забронировать столик в ресторане. Claude от Anthropic через computer use API может управлять браузером за вас. Agentforce от Salesforce ведёт кейсы поддержки от начала до конца без человека в цикле. Gartner прогнозирует, что к концу 2026 года 40% корпоративных приложений будут с интегрированными ИИ-агентами под конкретные задачи — против менее чем 5% в 2025-м.

Скриншот интерфейса computer use в Anthropic Claude: диалог разрешения, в котором пользователь одобряет автономные действия браузера — иллюстрация проблемы доверия в агентных ИИ-системах
Скриншот: Anthropic Claude computer use, 2025 (для редакционной иллюстрации).

UX-проблема, которая возникает в связи с этим, является на данный момент самой интересной в нашей сфере: как разработать интерфейс для агента, которому сам по себе интерфейс не нужен для выполнения своей работы, но пользователям которого он абсолютно необходим, чтобы довериться этому агенту?

Бен Шнейдерман в Human-Centered AI (Oxford University Press) годами задаёт версию этого вопроса. Он утверждает, что доминирующая рамка ИИ как автономного агента, заменяющего человеческое суждение, и технически преждевременна, и этически опасна — и предлагает вместо этого высокую степень человеческого контроля в сочетании с высокой автоматизацией. Не одно за счёт другого. Цель — не минимизировать участие человека; цель — сделать надзор читаемым, доступным и необременительным. Модель Шнейдермана — это верный ориентир для агентного UX: не автономия против контроля, а автономия с контролем — встроенная в систему с самого начала.

Это парадокс прозрачности агентного дизайна. Агент, который работает молча, эффективен и пугает. Агент, который комментирует каждое действие, вызывает доверие и выматывает. Задача дизайна — найти правильный баланс: достаточно, чтобы пользователь чувствовал контроль, не настолько, чтобы его захлестнул поток системных логов.

Трёхэтапная схема моментов, от которых зависит доверие в агентном UX: 1. Планирование (агент показывает намерение), 2. Исполнение (агент действует), 3. Передача результата (агент отдаёт итог) — с подписью «три момента, в которых агентный UX либо зарабатывает доверие, либо его разрушает»
Схема автора.

Лучшие паттерны агентного UX, из внедрённых в реальные продукты, делят три свойства:

Прозрачность планирования. Прежде чем действовать, агент показывает, что намерен сделать. Не на системном языке («выполняю POST-запрос к /api/calendar/event»), а на человеческом («Я забронирую столик на 19:00 в том ресторане, который вы упомянули — сначала проверить доступность?»). Именно в этот момент предварительного просмотра формируется или разрушается доверие. Он отражает многоэтапное поведение планирования, описанное в исследованиях по многоагентному обучению с подкреплением, где скоординированные агенты должны сообщать о запланированных действиях перед их выполнением, чтобы поддерживать согласованность системы.

Постепенное делегирование. Автономия заслуживается, а не дается изначально. Системы вроде агента Intercom начинают с простых задач с высокой уверенностью, а перед более рискованными действиями спрашивают разрешения. История одобрений пользователя становится моделью доверия. Агент получает больше свободы по мере демонстрации своей надежности. Это воплощение принципа Шнайдермана «высокий уровень контроля плюс высокая степень автоматизации»: человек остается в цикле не за счет выполнения работы, а за счет установления границ.

Плавный перехват управления. В любой точке агентного рабочего процесса пользователь должен иметь возможность сказать «стоп» и вернуть контроль, не вызывая при этом катастрофических последствий. Звучит просто. Но реализовать это — не так просто. Агентные системы часто выполняют необратимые действия (отправка электронного письма, бронирование авиабилета), которые невозможно аккуратно отменить, а это означает, что задача проектирования частично заключается в том, чтобы выявить точку невозврата до того, как она будет пересечена.

Есть один показательный пример из здравоохранения: клиническая система на базе ИИ, которая выдавала рекомендации без объяснения своих рассуждений, была отвергнута врачами. После доработки интерфейса рекомендации стали отображаться по одной, сопровождаемые панелью с подтверждающими данными и возможностью отклонить рекомендацию одним кликом. Система была немедленно принята на вооружение. Сам ИИ не изменился. Изменился только интерфейс. В этом и заключается основная идея «агентного UX»: объясняемость — это не просто функция, необходимая для соблюдения нормативных требований, — это и есть сам продукт.

Для дизайнеров это имеет огромное значение. Мы теперь проектируем не просто состояния, а модели поведения. Не только то, как выглядит интерфейс, но и то, что он делает, когда вы не смотрите на него. Вопросы меняются с «что видит пользователь?» на «во что пользователю нужно верить, чтобы доверять этой системе?». Это уже не столько визуальный дизайн, сколько — честно говоря — философия сознания.

Сквозная линия: от взаимодействия к намерению

Если отвлечься от конкретных форм-факторов, становится заметна определённая закономерность.

В своей фундаментальной работе по ментальным моделям Дон Норман установил, что дизайн терпит неудачу, когда представления пользователей о системе расходятся с тем, как она на самом деле работает. На протяжении тридцати лет эта концепция исходила из того, что пользователи приступают к работе с интерфейсом, уже имея сформированное намерение, и нуждаются лишь в средствах для его реализации.

Меню существует, потому что мы считали, что пользователь знает, какой пункт меню хочет открыть. Форма — потому что знает, какое поле заполнить. Вся система традиционного UX построена на предположении, что намерение пользователя уже сформировано к моменту его перехода на страницу.

Двухколоночная схема: старая UX-парадигма (Пользователь, затем Интерфейс, затем Система) против новой (Пользователь, затем Цель, затем Чат/Голос/Агент, затем Система) — объект дизайна сместился с взаимодействий на намерение
Схема автора.

Это допущение всегда было неверным — пользователи приходят с целями, а не с намерениями — но это была продуктивная фикция, которая тридцать лет работала достаточно хорошо.

Новые форм-факторы не исходят из этого предположения. Чат позволяет пользователям формулировать цели своими словами, а система сама определяет их замысел. Голосовое управление позволяет им формулировать цели, когда у них заняты руки. Агентные системы позволяют им сформулировать цели один раз, после чего система самостоятельно выполняет многоэтапный план для их достижения. Общим для всех трёх подходов является переход от взаимодействия к намерению как основному объекту проектирования.

Это означает, что работа дизайнера меняется не просто по степени, а по сути. Мы больше не являемся в первую очередь архитекторами последовательности взаимодействия. Мы — архитекторы доверительных отношений между людьми и системами, действующими от их имени. Мы проектируем с расчётом на делегирование полномочий. Мы проектируем с учётом неоднозначности. Мы проектируем с учётом разрыва между тем, что говорит пользователь, и тем, что он на самом деле имеет в виду.

Это сложнее, чем спроектировать оформление заказа. Нужны новые инструменты, новые методы оценки — исследования взаимодействия человека и ИИ уже предлагают методологии для измерения того, чувствует ли пользователь себя достаточно информированным и контролирующим ситуацию, помимо того, завершил ли он задачу, — а также новое этическое понимание того, что значит отдавать принятие решений системе, которую вы построили.

Что это значит, если вы дизайнер

Последствия этого сдвига не абстрактны.

Если разрабатываете интерфейсы чата, ваша самая сложная задача — понять, когда чат не является правильным решением. Успешными становятся не те продукты, в которых используется самый мощный ИИ, а те, которые точно знают, какие взаимодействия следует реализовывать в диалоге, а какие — в форме. Такое суждение относится к сфере дизайна, а не к сфере инженерии.

Если проектируете голосовые интерфейсы, ваша ментальная модель должна выйти за пределы экрана. Теперь вы проектируете время (задержка важнее макета), контекст (что знает и помнит пользователь?) и восстановление (что происходит, когда система не понимает?). Набор инструментов здесь другой: звуковая обратная связь, тактильные ощущения, пространственные подсказки, стратегии восстановления диалога.

Если вы проектируете агентные системы, вы в самой новой из трёх территорий — с наименьшим числом устоявшихся паттернов и самыми высокими ставками. Ваши дизайнерские решения о прозрачности, контроле управления и плавном делегировании определят, почувствует ли пользователь себя самостоятельным или будто под надзором, уверенным в себе или тревожным. Это не выборы ради эстетики — они имеют реальные последствия для того, насколько люди будут доверять системам ИИ в широком масштабе и во всех отраслях.

А если вы занимаетесь всеми тремя аспектами одновременно — а именно так все чаще выглядит процесс создания современного продукта — вам приходится решать не только задачу проектирования, но и задачу координации: как создать единый пользовательский опыт для различных форм-факторов, которые работают на основе принципиально разных моделей взаимодействия?

Напоследок о том, что не меняется

Все эти перемены могут создать ощущение, будто мир полностью изменился. Но это не так.

Пользователи по-прежнему хотят чувствовать себя понятыми. По-прежнему боятся потерять контроль. По-прежнему наказывают непрозрачность и вознаграждают честность. По-прежнему бросают продукты, которые заставляют чувствовать себя глупыми или медленными. Основы человеческой психологии не изменились — изменились лишь поверхности, на которые они проецируются.

Лучшие UX-дизайнеры всегда стремились к тому, чтобы люди чувствовали уверенность в себе и что их понимают.

Чат, голос и агенты — новые инструменты для этой работы.

Музыка — ясность, доверие, удовольствие, уважение к времени и вниманию пользователя — та же, что всегда. Изменилось то, что у дирижёра теперь гораздо больший оркестр.

Дополнительное чтение

Перевод статьи "The interface has left the building" @Om Prakash.

Комментарии