Top.Mail.Ru
Медиа imot.io
AI и коммуникации

Смежное возможное – почему технологии ждут своего часа

Эдисон запатентовал фонограф в феврале 1878 года. В первой же публичной статье он описал десять применений своего изобретения. Первое — диктовка и деловая переписка без помощи стенографа.

То, что мы сейчас называем речевой аналитикой, было сформулировано как задача 147 лет назад.

Почему же коммерческие системы расшифровки речи появились только в 1990-х, а по-настоящему заработали лишь в 2020-х? Что случилось между 1878 и 2025 годом? Ответ на этот вопрос даёт концепт, который придумал биолог Стюарт Кауфман и применил к истории технологий Стивен Джонсон. Концепт называется «смежное возможное».

Он объясняет не только, почему фонограф стал патефоном, а не офисным инструментом. Он объясняет, что происходит сейчас с AI — и почему ускорение последних двух лет выглядит именно так, как оно выглядит.

Как Кауфман описал эволюцию и почему это работает для технологий

Стюарт Кауфман — теоретический биолог, один из пионеров теории сложных систем. В книге «At Home in the Universe» (1995) и затем в «Investigations» (2000) он сформулировал идею, которую назвал «adjacent possible» — смежное, или соседнее, возможное.

В биологии концепт описывает следующее. В любой момент эволюции существует не бесконечное, а строго ограниченное множество изменений, которые могут произойти. Клетка не может за один шаг превратиться во что угодно. Она может сделать только то, для чего у неё уже есть молекулярные «соседи» — химические реакции, готовые произойти при малейшем изменении конфигурации. Следующий шаг возможен только из текущего состояния, а не из любого произвольного состояния системы.

Кауфман на странице в Edge.org описывал это так: биосфера расширяет своё смежное возможное настолько быстро, насколько может поддержать новую сложность. Каждый реализованный шаг открывает новые соседние шаги, которых раньше не существовало.

Стивен Джонсон в книге «Where Good Ideas Come From» (2010) взял этот концепт и перевёл его в язык инноваций. Он показал: технологические изобретения подчиняются той же логике, что и эволюция. eBay невозможно было создать в 1950-х — не потому что идея была плохой, а потому что не было ни персональных компьютеров, ни интернета, ни платёжных систем. Каждого из этих компонентов не существовало. Когда все три появились и накопились — нужная дверь открылась почти мгновенно.

Механизм простой. В каждый момент времени существует набор технологий, практик и инфраструктуры — это «текущая комната». Из неё видны соседние двери, за которыми стоят следующие возможности. Но за дверями дальше, чем одна комната, — темнота. Туда нельзя попасть без промежуточных шагов.

Самолёт нельзя было изобрести в XVIII веке. Идея полётных аппаратов тяжелее воздуха существовала давно — Леонардо да Винчи, например, делал эскизы летательных машин ещё в XV веке. Но без двигателей внутреннего сгорания, без металлургии, позволяющей делать лёгкие жёсткие конструкции, без достаточного понимания аэродинамики — никакой самолёт не полетит. Братья Райт в 1903 году оказались в нужной комнате: двигатели уже существовали, материалы стали достаточно лёгкими, а базовая теория подъёмной силы — изученной.

Из этого следует важный, хотя и неочевидный вывод. Многие технологии формулируются правильно — по задаче, по принципу, по применению — за десятки и сотни лет до того, как реально начинают работать. Идея верна. Компонентов нет.

Бабидж, фонограф и «отложенные гипотезы»

Аналитическая машина Чарльза Бэббиджа — один из самых красноречивых примеров «доопережающего» изобретения. В 1830-х годах Бэббидж спроектировал полноценный программируемый компьютер с памятью, процессором и условными переходами. Концептуально он был абсолютно верен. Машина просто не могла быть построена — викторианская точность механической обработки металлов не позволяла изготовить десятки тысяч деталей с допусками в тысячные доли дюйма. Современные симуляции показывают: идея работала. Компонент был недоступен.

Фонограф Эдисона — история более конкретная и более прямо связанная с тем, что мы называем речевой аналитикой сегодня.

19 февраля 1878 года Томас Эдисон получил патент на фонограф — цилиндрический барабан, способный записывать и воспроизводить звук. В июне того же года в журнале North American Review он опубликовал статью «The Phonograph and Its Future» с перечнем десяти будущих применений своего изобретения.

Первым пунктом шло следующее: «Letter writing and all kinds of dictation without the aid of a stenographer» — переписка и все виды диктовки без помощи стенографа. Библиотека Конгресса США подтверждает: Эдисон изначально видел фонограф именно как офисный инструмент. Музыкальные пластинки появились позже и оказались куда более массовым применением — но это не был изначальный замысел.

Почему офисный инструмент не получился?

Машина умела одно: сохранять звук. Чтобы превратить запись в текст, всё равно нужен был человек. Стенограф слушал запись и расшифровывал её вручную — производительность труда вырастала незначительно. Разрыв между «записать звук» и «извлечь смысл из звука» оставался пропастью.

Задача была правильно сформулирована. Компонент — автоматическое распознавание речи — отсутствовал.

Семьдесят лет от записи до распознавания

История того, как этот компонент появился, занимает почти столетие. Это история о последовательном открытии соседних дверей.

1952 год. Audrey, Bell Labs. Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали систему Audrey для распознавания произносимых цифр одного говорящего. Система работала с акустическими отпечатками — она искала характерные звуковые паттерны, называемые формантами. Audrey умела распознавать числа от 0 до 9 и только голос обученного оператора. Это был первый рабочий прототип, доказавший принцип.

1962 год. IBM Shoebox, Всемирная выставка. IBM представила машину, умевшую распознавать 16 слов: цифры от 0 до 9 плюс команды plus, minus, false, total, subtotal и off. Главным предназначением была устная арифметика. Выступление на Всемирной выставке в Сиэтле произвело впечатление, однако коммерческой технологии из Shoebox не вышло. Словарь в 16 слов был слишком мал для любого делового применения.

1990 год. Dragon Dictate. Первый коммерческий продукт для автоматической расшифровки речи с реальным словарём. Dragon Dictate продавался за $9 000 и предлагал словарь из 80 000 слов — но требовал произносить каждое слово отдельно, с паузами. Это была уже рабочая технология, но крайне ограниченная в скорости и неудобная. Быстрые процессоры сделали её возможной — это был компонент, который до 1990-х просто не существовал в потребительском сегменте.

От 1878 до 1990 года — 112 лет от правильно сформулированной задачи до первого коммерческого решения.

И всё же в 1990-х и 2000-х речевая аналитика в понимании Эдисона — массовый офисный инструмент, извлекающий смысл из разговоров — по-прежнему не существовала. Потому что распознавание речи и понимание речи — разные вещи.

Распознать — значит превратить звук в набор слов. Понять — значит извлечь из этих слов структурированную информацию: о чём был разговор, что хотел говорящий, что пошло не так, какое следующее действие нужно предпринять. Второй компонент дозревал дольше.

Три компонента, которые наконец сошлись

В начале 2020-х три компонента — запись звука, распознавание речи в текст и извлечение смысла из текста — наконец сошлись в единый контур. Не по отдельности, как раньше, а как работающая система.

Запись была решена ещё с Эдисона. Высококачественное распознавание речи — в 2010-е годы, когда статистические модели достигли приемлемой точности. Но извлечение смысла — разметка, классификация, обнаружение паттернов, ответы на содержательные вопросы — стало массово доступным только с появлением больших языковых моделей.

До 2022 года сценарий был таким: звонок записан, транскрибирован — и дальше человек сам читал текст и думал. Или система искала ключевые слова по заданному списку — «скидка», «претензия», «конкурент» — и выдавала примитивную статистику. Это был не смысл, а поверхностный поиск.

С языковыми моделями появилась возможность задавать содержательные вопросы к тексту разговора: «Упомянул ли менеджер следующий шаг?», «Как клиент отреагировал на цену — согласился, попросил скидку или завершил разговор?», «Какие темы поднимал клиент, не входящие в скрипт?». Ответы стали содержательными — не по ключевым словам, а по смыслу.

Это и есть момент схождения трёх компонентов. Комната, в которую мы наконец вошли, — та самая, которую Эдисон описал в 1878 году.

Что Epoch AI зафиксировал в 2024 году

Ускорение AI в последние два года — это не маркетинговый нарратив. Его зафиксировали измерениями.

Исследовательская организация Epoch AI отслеживает прогресс в возможностях языковых моделей по нескольким независимым метрикам. В апреле 2024 года они опубликовали данные: лучший результат на индексе Epoch Capabilities Index рос почти вдвое быстрее в последние два года по сравнению с двумя предыдущими. Ускорение составило около 90%. Три из четырёх измеряемых метрик показали статистически значимое ускорение — особенно в программировании и математике.

Что именно это ускорило? Появление reasoning models — моделей, которые не просто генерируют текст, но и последовательно рассуждают, проверяя промежуточные шаги. Выход OpenAI o1 установил масштабирование вычислений на этапе инференса (то есть в момент ответа, а не только при обучении) как новый вектор развития. Оказалось, что «думать дольше» работает — и это открыло новую дверь.

По данным MMLU — одного из стандартных академических бенчмарков — точность языковых моделей выросла с 70% в 2022 году до более 90% в 2025-м. Параллельно появились мультиагентные системы: это не одна модель, а несколько специализированных агентов, каждый из которых решает свою часть задачи и передаёт результат следующему. AutoGPT, Microsoft AutoGen, OpenAI Operator — примеры из 2024–2025 годов. Модель, которая нанимает себе в помощники ещё десять моделей и вместе они решают задачу, которая казалась невозможной три месяца назад, — это уже не метафора. Это описание конкретных инструментов.

PwC в опросе компаний, внедривших AI-агентов в 2025 году, зафиксировала: 66% отчитались о росте производительности, 57% — о снижении затрат. Скорость открытия соседних дверей сейчас измеряется кварталами, а не десятилетиями.

Почему «не получилось полгода назад» и «это невозможно» — разные вещи

Вокруг AI много обещаний с конца 2022 года: «заменит колл-центр», «заменит врача», «заменит юриста». Часть этих обещаний правильно формулирует задачу. Но «соседние двери» для каждой задачи открыты по-разному.

Автоматизация простых повторяющихся разговоров в сервисе — дверь, которая открылась в 2023–2024 годах. Замена врача в диагностике — дверь, рядом с которой ещё нет нескольких нужных компонентов: регуляторной базы, отработанных протоколов ответственности, достаточной точности в специфических медицинских сценариях.

Юридическая работа — между этими крайностями, и разные виды юридических задач открылись в разные моменты.

Правило, которое здесь работает: задача сформулирована правильно, но нужно спрашивать не «можно ли это сделать в принципе», а «все ли компоненты уже доступны». Если один компонент отсутствует — технология не заработает, как бы правильно ни была сформулирована задача.

Это полезная рамка для бизнеса, который смотрит на AI без иллюзий. Есть гипотезы, которые раньше не проверялись — потому что компонента не было. Качественной транскрибации на русском языке по приемлемой цене ещё три-четыре года назад не существовало. Языковых моделей, способных осмысленно анализировать структуру разговора на русском, — тоже. Теперь оба компонента есть.

Значит, гипотезы, которые откладывались три года назад, сейчас можно достать и проверить.

Речевая аналитика как закрытая задача Эдисона

Если вернуться к фонографу — история речевой аналитики приобретает неожиданную завершённость.

Эдисон в 1878 году сформулировал задачу: автоматически фиксировать и обрабатывать деловые коммуникации так, чтобы не зависеть от ручного труда стенографа. Машина записывает, система понимает, бизнес получает структурированный результат.

До 2020-х это работало в самом приблизительном смысле. Записать — да. Транскрибировать — да, но с ошибками и дорого. Понять, что именно произошло в разговоре и что с этим делать, — нет.

Сейчас — да, и это принципиально иная ситуация.

Контакт-центр или отдел продаж с платформой речевой аналитики получает не просто транскрипты. Получает ответы на вопросы, которые руководителю раньше нужно было получать через выборочное прослушивание: «На каком этапе разговора чаще всего уходит клиент?», «Какие возражения менеджеры не закрывают?», «Есть ли паттерн у тех разговоров, которые заканчиваются продажей, — и чем он отличается от разговоров, которые заканчиваются отказом?»

Это именно то, что Эдисон называл «диктовкой без помощи стенографа» — только на 147 лет позже и на несколько порядков мощнее, чем он мог себе представить.

Важно понимать: речевая аналитика — это не «AI вместо человека». Это AI + человек. Система не принимает управленческие решения. Она извлекает из ста процентов разговоров структурированную информацию, которую раньше можно было получить только из одного-двух процентов разговоров через ручное прослушивание. Руководитель или аналитик интерпретирует эту информацию и принимает решение. Что поменять в скрипте. Кому из менеджеров нужна дополнительная работа над возражениями. Какой продукт клиенты спрашивают, но не находят в ответах.

Это не замена человека. Это расширение того, что человек может видеть.

Как использовать концепт в работе

Концепт «смежного возможного» полезен не только как исторический фрейм. Он даёт конкретный инструмент для оценки AI-новостей и собственных гипотез.

Шаг первый. Когда вы видите новость об очередном AI-сервисе или возможности, попробуйте мысленно разобрать задачу на компоненты. Что нужно, чтобы это работало? Какой компонент ключевой — и он уже существует или только обещается?

Шаг второй. Покопайтесь в собственных «отложенных гипотезах». Это идеи, которые вы или ваша команда отложили — не потому что задача была плохой, а потому что нужный инструмент или данные были недоступны. «Мы пробовали анализировать звонки — было слишком дорого и неточно». «Мы хотели автоматически отслеживать, как менеджеры закрывают возражения — но системы не было». «Мы думали об автозаполнении карт пациентов во время приёма — но транскрибация была слишком медленной и дорогой».

Каждая из этих формулировок — потенциально «отложенная гипотеза», которую стоит достать и перепроверить. Компонент мог появиться — и то, что не работало полгода или два года назад, сейчас может быть реализуемо.

Шаг третий. Помните о различии между «задача правильно сформулирована» и «все компоненты уже есть». Это спасает от двух крайностей: от хайпа («AI всё заменит немедленно») и от избыточного скептицизма («это невозможно»). Большинство разумных AI-применений — где-то посередине: задача правильная, но открытие нужной двери — дело конкретного момента, а не абстрактного будущего.

Быть точным в этом различии — значит принимать более качественные решения о том, куда инвестировать время и ресурсы.

Итоги

Смежное возможное — не просто красивая метафора из биологии. Это описание механизма, по которому работают технологические переходы. Понимание этого механизма объясняет и историю, и то, что происходит прямо сейчас.

Эдисон правильно назвал задачу в 1878 году. Два ключевых компонента — автоматическое распознавание и понимание речи — созревали 112 и 144 года соответственно. Бэббидж правильно описал компьютер в 1830-х, но нужная точность механической обработки появилась только с электроникой — через сто лет.

AI в 2020-х переживает момент, когда сразу несколько компонентов — массовые языковые модели, мультиагентные системы, дешёвая транскрибация, понимание контекста в неструктурированных текстах — появились в доступном для бизнеса виде за очень короткое время. Epoch AI измерил это ускорение: 90% прирост скорости прогресса к апрелю 2024 года. Это не ощущение — это данные.

Для бизнеса это означает: сейчас хорошее время для «инвентаризации отложенных гипотез». Тех идей, которые не заработали раньше из-за нехватки одного компонента. Компонент мог появиться — и тогда правильно сформулированная задача наконец становится реализуемой.

Различие между «не получилось полгода назад» и «это невозможно в принципе» — одно из самых практически важных различий, которые стоит держать в голове при работе с AI-инструментами сегодня.

Хотите проверить свои «отложенные гипотезы»?

В imot.io мы работаем с компаниями, которые хотят понять, что именно из разговоров с клиентами и внутри команды поддаётся автоматическому анализу уже сейчас — и что ещё требует времени. Это честный разговор о том, что работает, а что пока только обещается.

Если у вас есть задача, которая раньше не решалась — напишите нам. Разберёмся, открылась ли нужная дверь.
Источники

Stuart Kauffman — The Adjacent Possible, Edge.org

Stuart Kauffman — «At Home in the Universe» (1995), Oxford University Press; «Investigations» (2000), Oxford University Press

Steven Johnson — «Where Good Ideas Come From: The Natural History of Innovation» (2010), Riverhead Books

Thomas Edison — «The Phonograph and Its Future», North American Review, June 1878 (JSTOR)

History of the Cylinder Phonograph — Library of Congress, History of Edison Sound Recordings

Thomas Edison patents the phonograph, February 19, 1878 — History.com

Speech Recognition from Audrey to Alexa — A Brief History — Dictate-IT

Speech Recognition Through the Decades: How We Ended Up With Siri — PCWorld

A Brief History of ASR: Automatic Speech Recognition — Sonix

AI capabilities progress has sped up — Epoch AI, April 2024

Have AI Capabilities Accelerated? — Epoch AI

Multi-AI Agents Systems in 2025: Key Insights, Examples, and Challenges — Ioni.ai

Babbage’s Analytical Engine: Unready 19th-Century Computer — Thought Hatch

AI Benchmarks 2025: Performance Metrics Show Record Gains — SentiSight.ai