Развитие искусственного интеллекта породило собственный технический язык — и разобраться в нём с ходу непросто даже опытному пользователю. Термины вроде LLM, RAG, RLHF, инференса или трансформеров мелькают почти в каждой новости об ИИ, на любой профильной конференции и в описаниях новых продуктов, но простыми словами их объясняют редко. Этот глоссарий собирает ключевые понятия отрасли в одном месте, выстраивает их от базовых к более узким и будет пополняться по мере того, как индустрия обрастает новыми терминами.

Иллюстрация к материалу об искусственном интеллектеИсточник изображения — techcrunch.com

Искусственный общий интеллект (AGI)

AGI — понятие настолько же важное для отрасли, насколько и размытое. В общем смысле так называют систему ИИ, способную превзойти среднего человека в большинстве задач. Глава OpenAI Сэм Альтман сравнивал AGI с «коллегой среднего уровня», которого реально было бы нанять на работу. В уставе самой OpenAI встречается более формальная формулировка — высокоавтономные системы, превосходящие людей в большинстве экономически значимых видов деятельности. У Google DeepMind акцент немного другой: там AGI описывают как ИИ, который способен решать когнитивные задачи как минимум не хуже человека. Из-за этого разброса формулировок споры о том, что именно считать AGI и насколько к нему приблизилась та или иная модель, идут в отрасли постоянно.

Базовая модель (Foundation Model)

Базовая (или фундаментальная) модель — это крупная модель, обученная на огромном и разнородном массиве данных так, чтобы её затем можно было приспособить под множество разных задач. Именно базовые модели лежат в основе большинства современных ИИ-продуктов: одну и ту же модель дообучают и превращают то в чат-ассистента, то в инструмент для программирования, то в генератор изображений. Большие языковые модели — самый известный, но не единственный тип базовых моделей: по той же логике строят модели для работы с изображениями, звуком и видео.

Большие языковые модели (LLM)

Большие языковые модели, или LLM, — это модели ИИ, на которых работают популярные ассистенты вроде ChatGPT, Claude, Google Gemini, Meta* AI Llama, Microsoft Copilot или Mistral Le Chat. Когда пользователь общается с ИИ-ассистентом, он взаимодействует именно с LLM, которая обрабатывает запрос напрямую или с помощью подключённых инструментов — веб-поиска, интерпретатора кода и так далее.

LLM — это глубокие нейронные сети из миллиардов числовых параметров (весов), которые изучают связи между словами и фразами и в итоге формируют своего рода многомерную карту языка. Такие модели обучают на закономерностях, найденных в миллиардах книг, статей и расшифровок текстов. Когда пользователь отправляет запрос, модель генерирует наиболее вероятное продолжение, соответствующее этому запросу.

Нейронная сеть (Neural Network)

Нейронная сеть — многослойная алгоритмическая структура, лежащая в основе глубокого обучения и, в более широком смысле, всего бума генеративного ИИ, который начался с появлением больших языковых моделей.

Сама идея опираться на плотно связанные нейронные пути человеческого мозга при проектировании алгоритмов обработки данных известна ещё с 1940-х годов, но по-настоящему раскрыть потенциал этой теории удалось лишь с распространением графических процессоров (GPU) — изначально созданных для видеоигр. Эти чипы оказались хорошо приспособлены для обучения алгоритмов с гораздо большим числом слоёв, чем это было возможно раньше, что и позволило нейросетевым системам ИИ выйти на новый уровень в распознавании речи, автономной навигации и разработке лекарств.

Глубокое обучение (Deep Learning)

Глубокое обучение — разновидность машинного обучения, в которой алгоритмы строятся на основе многослойной искусственной нейронной сети. Такая архитектура позволяет находить куда более сложные закономерности, чем доступны простым моделям вроде линейной регрессии или деревьев решений. Сама идея многослойной структуры вдохновлена устройством взаимосвязанных нейронов в человеческом мозге.

Модели глубокого обучения способны сами находить важные признаки в данных — инженерам не нужно задавать их вручную. Такая структура позволяет алгоритму учиться на собственных ошибках и постепенно улучшать результат в процессе повторения. Обратная сторона — глубокому обучению требуется огромный объём данных для хорошего качества (обычно миллионы примеров и больше), а само обучение занимает заметно больше времени и ресурсов, чем у более простых алгоритмов.

Трансформер и механизм внимания (Transformer, Attention)

Трансформер — архитектура нейронной сети, представленная в 2017 году и с тех пор ставшая фундаментом практически всех современных больших языковых моделей. Её ключевая часть — механизм внимания (attention): он определяет, на какие другие слова во входном тексте модели стоит «обращать внимание», когда она осмысляет каждое конкретное слово. Именно внимание позволяет модели связать местоимение с нужным существительным несколькими предложениями ранее или не запутаться в переменных при написании кода. По сравнению с более ранними архитектурами трансформеры куда лучше удерживают контекст — во многом поэтому они и вытеснили предшественников.

Смесь экспертов (Mixture of Experts, MoE)

Смесь экспертов — архитектура, при которой большая модель разбита на множество меньших специализированных подсетей — «экспертов», — и для каждого фрагмента входных данных активируется лишь несколько из них, а не вся модель целиком. Специальный маршрутизатор решает, какие эксперты подключить к конкретному запросу. Такой подход позволяет держать колоссальное общее число параметров, но при этом сохранять низкую стоимость каждого ответа, потому что большая часть экспертов в любой момент простаивает. Именно MoE во многом объясняет, как удаётся строить очень крупные модели, не увеличивая пропорционально расходы на инференс.

реклама кормит Уточку 🦆

Промпт и промпт-инжиниринг (Prompt, Prompt Engineering)

Промпт — это запрос, инструкция или контекст, которые пользователь передаёт модели ИИ, чтобы направить её ответ. От формулировки промпта заметно зависит качество результата, поэтому вокруг составления удачных запросов сложилась целая практика — промпт-инжиниринг. Она включает приёмы вроде чётких инструкций, примеров желаемого ответа, разбиения задачи на шаги и указания нужного формата вывода. Хорошо составленный промпт нередко даёт больший прирост качества, чем переход на более мощную модель.

Системный промпт (System Prompt)

Системный промпт — это скрытые инструкции с повышенным приоритетом, которые задают общее поведение модели ещё до того, как пользователь введёт свой запрос. В нём прописывают роль ассистента, тон общения, ограничения и правила безопасности. Пользователь системный промпт обычно не видит, но именно он во многом определяет, как модель отвечает и от чего отказывается.

Контекстное окно (Context Window)

Контекстное окно — это максимальный объём текста, который модель способна удерживать «в поле зрения» за один раз, измеряемый в токенах. Всё, что выходит за его пределы, модель фактически забывает: если разговор или документ длиннее окна, более ранние фрагменты выпадают из внимания. Чем больше контекстное окно, тем с более длинными документами и сложными диалогами способна работать модель. Ограниченность окна — одна из причин, по которой для работы с большими массивами документов применяют механизмы внешнего поиска (см. RAG).

Токены и token throughput

Человек общается на естественном языке, а модель ИИ работает с данными через сложные алгоритмические процессы — и здесь на помощь приходят токены: базовые единицы человеко-машинного общения, представляющие небольшие фрагменты данных, которые обрабатывает или производит LLM. Их получают в процессе токенизации, разбивающей исходный текст на понятные модели единицы, — примерно так же компилятор переводит человеческий язык в машинный код. В коммерческих продуктах токены определяют и стоимость: большинство ИИ-компаний берут плату именно за количество обработанных токенов, поэтому чем активнее бизнес использует модель, тем выше счёт.

Проще говоря, токены — это небольшие фрагменты текста, часто части слов, а не целые слова, на которые языковая модель разбивает текст перед обработкой; с практической точки зрения их удобно приравнивать к «словам». Token throughput (пропускная способность по токенам) показывает, сколько токенов система способна обработать за единицу времени, — по сути, это мера того, сколько нагрузки ИИ-система может выдержать одновременно. От неё зависит, сколько пользователей модель обслуживает параллельно и насколько быстро каждый получает ответ, поэтому максимизация token throughput стала для команд, отвечающих за ИИ-инфраструктуру, почти навязчивой идеей.

Мультимодальность (Multimodal)

Мультимодальной называют модель, способную работать с разными типами данных сразу — не только с текстом, но и с изображениями, звуком, а иногда с видео. Такая модель может, например, «прочитать» текст на фотографии, описать содержимое картинки, разобрать голосовую заметку или, наоборот, сгенерировать изображение по текстовому запросу. Именно мультимодальность стоит за возможностью загрузить в ассистента скриншот или документ и обсудить его так же, как обычный текст.

Инференс (Inference)

Инференс — это запуск уже обученной модели ИИ, то есть момент, когда модель делает прогноз или вывод на основе данных, которые она видела при обучении. Важный нюанс: инференс невозможен без предварительного обучения — прежде чем эффективно экстраполировать закономерности, модель должна сначала их изучить на обучающем наборе данных.

Инференс способно выполнять самое разное оборудование — от процессора смартфона до мощных GPU и специализированных ИИ-ускорителей, — но не все справляются одинаково хорошо. Крупной модели на обычном ноутбуке для получения ответа может понадобиться значительно больше времени, чем на облачном сервере с топовыми ИИ-чипами.

Кэш памяти (Memory Caching)

Кэш памяти — важный механизм, ускоряющий инференс. По сути, кэширование — это способ оптимизации: в основе работы ИИ лежат высокоскоростные математические вычисления, и каждое из них потребляет энергию, поэтому кэширование сокращает число повторных вычислений, сохраняя часть результатов для будущих запросов. Разновидностей немало, но одна из самых известных — KV-кэширование (кэширование «ключ — значение»). Оно применяется в моделях на архитектуре трансформер и повышает эффективность, сокращая время и вычислительные затраты на генерацию ответа.

Галлюцинация (Hallucination)

Галлюцинацией в индустрии ИИ принято называть ситуацию, когда модель выдаёт недостоверную информацию, буквально придумывая факты. Это одна из главных проблем, влияющих на качество и доверие к генеративному ИИ.

Последствия бывают серьёзнее, чем кажется: недостоверный ответ может ввести пользователя в заблуждение и в отдельных сценариях привести к реальному вреду — например, если речь идёт о медицинском запросе, на который система выдаёт опасный совет. Считается, что склонность ИИ «фантазировать» связана с пробелами в обучающих данных. Именно проблема галлюцинаций подталкивает индустрию к более узким, специализированным моделям, а также к привязке ответов к проверенным источникам (см. ниже).

Привязка к источникам (Grounding)

Grounding, или «заземление», — это привязка ответов модели к найденным или заведомо надёжным данным: документам, базам, результатам поиска. Идея в том, чтобы модель опиралась не только на выученные при обучении закономерности, но и на конкретные проверяемые источники — тогда ответы становятся точнее, а вероятность галлюцинаций снижается. На практике grounding часто реализуют через механизмы внешнего поиска и указание источников прямо в ответе.

реклама кормит Уточку 🦆

Обучение модели (Training)

Разработка ИИ на основе машинного обучения включает этап, известный как обучение. Проще говоря, это процесс, в ходе которого модели «скармливают» данные, чтобы она находила в них закономерности и генерировала полезный результат, — по сути, реакция системы на особенности данных, которая позволяет ей подстраивать выходной результат под нужную цель, будь то распознавание кошки на фото или сочинение хайку по запросу.

Обучение может обходиться дорого, поскольку требует большого объёма входных данных, а нужные объёмы со временем только растут. Именно поэтому гибридные подходы — например, точная настройка уже обученной модели на целевых данных — помогают контролировать затраты, не начиная процесс с нуля.

Точная настройка (Fine-tuning)

Точная настройка — это дообучение уже готовой модели ИИ, цель которого — сделать её лучше в узкой задаче или предметной области, отличной от того, на чём модель фокусировалась изначально. Для этого модели скармливают новый, специализированный набор данных, ориентированный на конкретную задачу.

Многие стартапы берут большую языковую модель за основу коммерческого продукта, а затем повышают её полезность именно для своего сегмента — дополняя базовое обучение точной настройкой на собственных отраслевых данных и накопленной экспертизе.

Трансферное обучение (Transfer Learning)

Трансферное обучение — техника, при которой уже обученная модель ИИ становится отправной точкой для разработки новой модели под другую, но обычно смежную задачу. Это позволяет повторно использовать знания, накопленные моделью в предыдущих циклах обучения.

Такой подход экономит время и ресурсы на разработку, а ещё выручает, когда данных для новой задачи не так много. Но у него есть ограничение: модели, которые полагаются на трансферное обучение ради общих способностей, обычно всё равно нуждаются в дополнительном обучении на данных из своей узкой области, чтобы работать по-настоящему хорошо.

Обучение с подкреплением (Reinforcement Learning, RLHF)

Обучение с подкреплением — подход, при котором система учится методом проб и получает «вознаграждение» за правильные действия — по сути, как дрессировка питомца лакомством, только роль «питомца» играет нейросеть, а роль «лакомства» — математический сигнал успеха. В отличие от обучения с учителем, где модель работает с фиксированным набором размеченных примеров, здесь модель сама исследует среду, совершает действия и постоянно корректирует поведение на основе обратной связи. Такой подход особенно хорошо показал себя в играх, управлении роботами и в последнее время — в развитии способности больших языковых моделей рассуждать. Метод обучения с подкреплением на основе человеческой обратной связи (RLHF) сегодня — один из ключевых способов, которым ведущие лаборатории ИИ дополнительно настраивают модели, делая их полезнее, точнее и безопаснее.

Дистилляция (Distillation)

Дистилляция — техника, позволяющая перенести знания крупной модели ИИ в модель поменьше по схеме «учитель — ученик». Разработчики отправляют запросы модели-учителю и фиксируют её ответы, иногда сверяя их с эталонным набором данных для оценки точности. Затем на этих ответах обучают модель-ученика, которая постепенно учится приближаться по качеству к учителю.

Дистилляция удобна для того, чтобы получить компактную и более быструю модель на основе крупной, потеряв при этом минимум качества. Предположительно, именно так был получен GPT-4 Turbo — ускоренная версия GPT-4. Дистилляцию используют внутри все крупные ИИ-компании, но иногда её применяют и для того, чтобы «подтянуться» к моделям конкурента, — как правило, это прямое нарушение условий использования чужого API или чат-ассистента.

Веса (Weights)

Веса — основа обучения ИИ: они определяют, насколько значимым является тот или иной признак (входная переменная) в данных, на которых обучается система, и тем самым напрямую формируют итоговый результат модели.

Другими словами, веса — это числовые параметры, которые показывают, что именно важнее всего в наборе данных для конкретной задачи обучения. Работают они через умножение входных значений. В начале обучения веса обычно задаются случайным образом, но по ходу процесса корректируются так, чтобы результат модели всё точнее соответствовал поставленной цели. Например, модель для прогнозирования стоимости жилья может присваивать веса числу спален, типу дома, наличию парковки и другим признакам — и эти веса отражают, насколько сильно каждый параметр влияет на итоговую цену согласно данным, на которых модель обучалась.

Потери валидации и переобучение (Validation Loss, Overfitting)

Потери валидации — числовой показатель того, насколько хорошо модель ИИ обучается: чем ниже значение, тем лучше идёт процесс. Исследователи следят за ним как за своеобразным табелем успеваемости в реальном времени — по нему решают, когда остановить обучение, скорректировать гиперпараметры или проверить возможную проблему. Одна из главных вещей, которую помогает выявить этот показатель, — переобучение (overfitting): состояние, при котором модель фактически запоминает обучающие данные вместо того, чтобы находить закономерности, применимые к новым ситуациям. Разница похожа на ту, что есть между студентом, который действительно разобрался в материале, и тем, кто просто вызубрил прошлогодний экзамен.

Квантизация (Quantization)

Квантизация — приём, позволяющий уменьшить размер модели и ускорить её работу за счёт снижения точности, с которой хранятся её числовые параметры. Грубо говоря, вместо «тяжёлых» чисел высокой точности используются более «лёгкие» и компактные — модель начинает занимать меньше памяти и быстрее выдаёт ответы, обычно с минимальной потерей качества. Именно квантизация во многом делает возможным запуск довольно крупных моделей на обычных ноутбуках и смартфонах.

Вычислительные мощности (Compute)

Термин compute довольно многозначен, но чаще всего им обозначают вычислительную мощность, без которой модели ИИ попросту не могут работать. Именно этот ресурс питает всю индустрию: он нужен и для обучения моделей, и для их последующего развёртывания. Часто «compute» используют как сокращённое обозначение оборудования, которое эту мощность обеспечивает, — GPU, CPU, TPU и другие виды инфраструктуры, лежащие в основе современной индустрии ИИ.

Параллелизация (Parallelization)

Параллелизация — выполнение множества операций одновременно вместо последовательного, как если бы над разными частями одного проекта одновременно работали десять сотрудников вместо одного. В ИИ она лежит в основе и обучения, и инференса: современные GPU изначально проектируются для тысяч одновременных вычислений, что во многом и сделало их аппаратной основой всей отрасли. По мере усложнения систем ИИ и роста размеров моделей способность эффективно распределять нагрузку между множеством чипов и машин стала одним из ключевых факторов, определяющих скорость и стоимость разработки, а поиск оптимальных стратегий параллелизации превратился в отдельное направление исследований.

реклама кормит Уточку 🦆

RAG (генерация с дополненной выборкой)

RAG (Retrieval-Augmented Generation) — техника, при которой модель сначала находит подходящие документы или записи во внешнем источнике, а затем использует их, чтобы сформировать более точный и подкреплённый данными ответ. Без RAG языковая модель опирается только на то, что выучила при обучении, и не имеет доступа к свежей или закрытой информации. RAG решает эту проблему: это основной способ дать ИИ доступ к внутренним данным компании или к актуальным сведениям без полного дообучения модели. По сравнению с точной настройкой такой подход быстрее и дешевле, а информацию можно обновлять на лету, просто меняя содержимое базы, к которой обращается модель.

Эмбеддинги и векторные базы (Embeddings, Vector Database)

Эмбеддинги — это представление текста (или других данных) в виде наборов чисел — векторов, которые кодируют смысл так, что близкие по значению фрагменты оказываются рядом в числовом пространстве. Два предложения с похожим смыслом получат близкие эмбеддинги, даже если в них использованы разные слова. Когда пользователь задаёт вопрос ИИ-системе, запрос превращается в такой вектор и сопоставляется с заранее подготовленной базой векторов. Для быстрого поиска по миллионам таких представлений используют специальные векторные базы данных — именно на эмбеддингах строятся семантический поиск, рекомендательные системы и упомянутый выше RAG.

Цепочка рассуждений (Chain of Thought)

На простые вопросы мозг отвечает почти мгновенно — сравнить рост жирафа и кошки не составляет труда. Но там, где есть промежуточные шаги, без «ручки и бумаги» уже не обойтись. Классический пример: на ферме куры и коровы, вместе у них 40 голов и 120 ног — сколько тех и других? Чтобы получить верный ответ (20 кур и 20 коров), нужно составить и решить уравнение.

В контексте ИИ цепочка рассуждений — это разбиение задачи на промежуточные шаги для повышения качества итогового ответа. Модель тратит на генерацию больше времени, зато результат чаще оказывается верным — особенно в логике и программировании. Приём «думай пошагово» заметно улучшает точность на многошаговых задачах и служит основой для целого класса моделей рассуждений, о которых ниже.

Модели рассуждений и вычисления во время инференса (Reasoning Models, Test-Time Compute)

Модели рассуждений развивают классические большие языковые модели: перед выдачей ответа они генерируют промежуточные «рассуждающие» токены — фактически размышляют вслух, — и обучаются этому поведению с помощью обучения с подкреплением. За этим стоит важный сдвиг в индустрии, известный как вычисления во время инференса (test-time compute): точность повышают не только за счёт увеличения модели при обучении, но и за счёт того, что модели дают больше вычислительного «бюджета на раздумья» в момент ответа. Исследования показали, что модель поменьше, которой отведено достаточно времени на размышление, способна на сложных задачах обходить заметно более крупную. Плата за это — скорость и стоимость: такие модели отвечают дольше (от нескольких секунд до минуты и больше) и расходуют больше токенов на запрос, поэтому подходят прежде всего для задач, где цена ошибки высока.

ИИ-агент (AI Agent)

ИИ-агент — программа, которая использует технологии искусственного интеллекта, чтобы самостоятельно выполнять цепочку задач от имени пользователя. Это шаг вперёд по сравнению с обычным чат-ботом: агент способен оформить авансовый отчёт, забронировать столик в ресторане или написать и поддерживать код без постоянного участия человека. Поскольку направление ещё формируется, единого стандарта у термина нет — под «ИИ-агентом» разные компании иногда подразумевают разный уровень автономности. Общее у всех подходов одно: система должна уметь задействовать несколько инструментов ИИ подряд, чтобы довести многошаговую задачу до результата.

Агент кодирования (Coding Agent)

Это более узкое понятие, чем «ИИ-агент», применённое к разработке ПО. Вместо того чтобы просто предложить фрагмент кода на проверку человеку, агент кодирования способен самостоятельно писать, тестировать и отлаживать код — выполняя ту рутинную работу методом проб и ошибок, на которую у разработчика обычно уходит немало времени за день. Такие агенты умеют работать со всей кодовой базой целиком: находить ошибки, запускать тесты и вносить правки с минимальным контролем человека. Условно это похоже на найм очень быстрого стажёра, который не спит и не теряет концентрацию, — но, как и за любым стажёром, за ним всё равно нужно перепроверять результат.

Вызов инструментов и функций (Tool Calling, Function Calling)

Вызов инструментов (или функций) — механизм, благодаря которому модель не просто выдаёт текст, а формирует структурированный запрос на выполнение внешнего действия: обратиться к API, запустить поиск, произвести расчёт или получить данные из базы. Модель как бы говорит: «вызови такой-то инструмент с такими-то параметрами», а система выполняет вызов и возвращает результат обратно в разговор. Именно этот механизм превращает языковую модель из собеседника в исполнителя и лежит в основе работы ИИ-агентов.

Точки доступа API (API Endpoints)

Точки доступа API удобно представлять как скрытые «кнопки» на обратной стороне программы, которые другие программы могут «нажимать», чтобы заставить её что-то сделать. Разработчики строят на этих интерфейсах интеграции: одно приложение забирает данные из другого, а ИИ-агент напрямую управляет сторонним сервисом без ручного контроля человека. Такие скрытые «кнопки» есть у большинства умных устройств и облачных платформ, хотя обычный пользователь никогда их не видит. По мере того как ИИ-агенты становятся способнее, они всё чаще самостоятельно находят подходящие endpoints и используют их — открывая как полезные, так и не всегда предсказуемые сценарии автоматизации.

MCP (Model Context Protocol)

MCP (Model Context Protocol) — открытый стандарт, позволяющий моделям ИИ подключаться к внешним инструментам и данным — файлам, базам, приложениям вроде Slack или Google Drive — без того, чтобы разработчик писал отдельный коннектор под каждую пару «модель — сервис». Его часто сравнивают с разъёмом USB-C, только для ИИ: единый способ соединения вместо десятков несовместимых. Стандарт представила компания Anthropic в 2024 году, позже передав его Linux Foundation; его довольно быстро поддержали OpenAI, Google и Microsoft, что сделало MCP одним из самых стремительно распространившихся стандартов в недавней истории отрасли.

реклама кормит Уточку 🦆

Диффузия (Diffusion)

Диффузия — технология, на которой строится множество моделей ИИ, генерирующих изображения, музыку и текст. Идея пришла из физики: диффузионные системы постепенно «разрушают» структуру исходных данных — фотографии, аудиодорожки и так далее, — добавляя к ним шум, пока от исходника ничего не остаётся. В природе диффузия необратима: сахар, растворившийся в чае, уже не соберётся обратно в кусок. Но диффузионные модели ИИ, в отличие от физики, специально обучаются обратному процессу — восстанавливать данные из случайного шума, — и именно эта способность лежит в основе генерации изображений.

GAN (генеративно-состязательная сеть)

GAN — тип архитектуры машинного обучения, лежащий в основе ряда важных достижений генеративного ИИ в создании реалистичных данных, включая инструменты для deepfake. В основе GAN — пара нейронных сетей: одна генерирует данные, вторая оценивает, насколько они похожи на настоящие.

Обе модели фактически соревнуются друг с другом: генератор пытается «обмануть» дискриминатор, а дискриминатор — научиться безошибочно отличать искусственно созданные данные от настоящих. Это соперничество постепенно делает результат генератора всё более реалистичным без прямого вмешательства человека. GAN особенно хорошо показывают себя в узких задачах — например, создании фотореалистичных изображений или видео, — но плохо подходят для универсальных задач ИИ.

Open source и closed source

Open source относится к программному обеспечению — и всё чаще к моделям ИИ, — исходный код которого открыт для использования, проверки и изменения кем угодно. В мире ИИ ярким примером служит семейство моделей Meta Llama, а в мире операционных систем — Linux. Открытый подход позволяет исследователям и компаниям по всему миру опираться на чужие наработки, что ускоряет прогресс и даёт возможность независимой проверки безопасности — то, что закрытые системы обеспечить не могут. Closed source, напротив, означает закрытый код: пользоваться продуктом можно, а увидеть, как он устроен изнутри, — нет, как в случае с моделями GPT от OpenAI. Этот выбор между открытостью и закрытостью остаётся одним из главных предметов споров в индустрии ИИ.

Бенчмарки (Benchmarks)

Бенчмарк — стандартизированный набор задач, по которому измеряют и сравнивают способности моделей ИИ. Именно на бенчмарках строятся громкие заявления вроде «новая модель решает X% задач»: например, MMLU проверяет широкие знания, а SWE-bench — умение исправлять реальные ошибки в коде. За последние годы прогресс на таких тестах был стремительным, и часть из них модели уже фактически «прошли» под потолок. У бенчмарков есть и слабое место: модель может хорошо показывать себя на тесте, но заметно слабее — на живых задачах, поэтому к рейтингам стоит относиться как к ориентиру, а не как к окончательному приговору.

Выравнивание, безопасность и ограничители (Alignment, Guardrails)

Выравнивание (alignment) — направление, которое занимается тем, чтобы поведение модели ИИ соответствовало намерениям и ценностям человека: чтобы система была полезной, честной и не причиняла вреда. На практике это дополняется ограничителями (guardrails) — правилами и фильтрами, которые не дают модели выполнять опасные или недопустимые запросы. По мере роста возможностей моделей вопросы безопасности и выравнивания превратились из академической темы в один из центральных сюжетов всей индустрии, вокруг которого идут и технические исследования, и регуляторные споры.

Рекурсивное самоулучшение (RSI)

Как и AGI, рекурсивное самоулучшение — понятие о пороге, определяющем, насколько ИИ способен становиться умнее без участия человека. В сценарии RSI модель начинает совершенствовать саму себя без внешнего вмешательства, что приводит к резкому скачку возможностей и автономности. В самых радикальных версиях это описывают как катастрофический, сингулярный момент, после которого модель становится неуязвимой для внешнего контроля. Но у термина есть и куда более приземлённое прочтение — способна ли модель спроектировать своего преемника, — и именно эту, более практическую задачу пытаются решать инженеры. Ряд ИИ-стартапов прямо заявляет о цели построить рекурсивно самоулучшающиеся модели, но большинство из них отрицают апокалиптические сценарии, рассматривая RSI просто как следующий рубеж исследований.

Дефицит памяти («RAMageddon»)

RAMageddon — ироничное название малоприятной тенденции, охватившей всю технологическую индустрию: устойчивая нехватка чипов оперативной памяти (RAM), от которых зависит практически любая современная электроника. Причина — не авария на заводе и не стихийное бедствие, а осознанный выбор производителей. Три компании — Samsung, SK Hynix и Micron — контролируют свыше 95% мирового производства DRAM, и все три активно перенаправляют мощности с потребительской памяти на высокомаржинальную HBM для ИИ-ускорителей, спрос на которую практически не имеет потолка. Производство HBM крайне ресурсоёмко: по оценке TrendForce, один гигабайт HBM обходится примерно в четыре гигабайта площади обычной пластины DRAM.

По разным оценкам, в 2026 году ИИ-индустрия поглощает от 20% до 70% мирового производства памяти — цифры расходятся в зависимости от методики подсчёта, но направление тренда одинаково у всех аналитиков. Ещё в феврале 2026 года Micron свернул потребительский бренд Crucial, чтобы сосредоточиться на памяти для дата-центров, а Samsung и SK Hynix предупредили, что серьёзный дефицит сохранится как минимум до 2027 года. Гендиректор SK Hynix и вовсе назвал 2027-й потенциально худшим годом в истории отрасли по уровню дефицита, а спрос, по его словам, способен превышать производственные мощности компании и после 2030 года. По данным аналитиков, розничные цены на модули DDR5 в 2026 году уже выросли в два-три раза, а к 2027-му, по ряду прогнозов, могут удвоиться ещё раз.

Для рынков СНГ это означает подорожание готовой техники — от смартфонов и ноутбуков до серверного оборудования, — а также сокращение объёма памяти в новых устройствах среднего сегмента: производители возвращаются к конфигурациям пятилетней давности, чтобы удержать цену. Пока заметных признаков скорого разрешения дефицита нет.

Материал будет дополняться по мере появления новых терминов в индустрии ИИ.

* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.