Исследование Google: почему LLM не могут вспомнить известные им факты

В новой научной статье исследователей Google установлено, что современные крупные языковые модели (LLM — Large Language Model, тип моделей, лежащих в основе таких систем ИИ, как ChatGPT или Gemini) в процессе обучения «запоминают» 95–98% фактов, однако при формировании ответа не могут напрямую вспомнить от 26 до 34% этих же фактов.
Исследователи объясняют это разницей между «кодированием» (encoding — сохранением информации во внутренних параметрах модели) и «вспоминанием» (recall — воспроизведением сохранённой информации в момент запроса). У продвинутых моделей, таких как Gemini-3-Pro и GPT-5, кодирование происходит почти полностью — на 95–98%, однако именно вспоминание становится «узким местом»: более 70% ошибок GPT-5.2 связаны именно с неспособностью вспомнить факт, а у более мощных моделей эта доля ещё выше.
Одно из самых интересных открытий заключается в том, что порядок «субъекта» и «объекта» в факте (например, в предложении «Группа Oasis дала свой первый концерт в клубе Boardwalk» «Oasis» — субъект, а «клуб Boardwalk» — объект) влияет на способность модели его вспомнить. Если вопрос задан с обратным порядком (например, «Какая группа впервые выступила в клубе Boardwalk?»), модели гораздо труднее вспомнить факт — хотя тот же самый факт она легко узнаёт, если он предложен в формате вопроса с вариантами ответа (multiple-choice).
Исследователи установили, что различная формулировка вопроса существенно не влияет на способность к вспоминанию — решающим фактором оказывается именно обратный порядок субъекта и объекта. Также было замечено, что трудности с вспоминанием чаще возникают для редко встречающихся фактов — даже если модель на них обучалась. Режим «размышления» (thinking) помогал вспомнить 40–65% фактов, которые ранее не удавалось вспомнить напрямую, однако это обходится значительно дороже с точки зрения вычислительных ресурсов.
Исследователи отмечают, что масштабирование модели (scaling) не решает эту проблему с вспоминанием. С точки зрения SEO (оптимизации сайта под поисковые системы), практический вывод из этого исследования таков: изложение фактов на веб-страницах в том порядке, в котором их обычно формулируют люди (в последовательности субъект-объект), может повысить вероятность того, что страница будет правильно «вспомнена» в ответах ИИ — хотя напрямую результатами данного исследования это и не доказано.
Похожие статьи

Брендам важнее соответствие, а не число подписчиков — новое исследование креатор-маркетинга
Новое исследование CreatorIQ показывает: при выборе креатора бренды в первую очередь оценивают соответствие бренду, а число подписчиков ставят на последнее место. Однако размер гонорара по-прежнему в основном зависит именно от числа подписчиков.

Google теперь «создаёт» целый интерфейс прямо в результатах поиска — что это значит для владельцев сайтов
Технология генеративного интерфейса Google приходит в AI Overviews: теперь поисковая система в реальном времени создаёт интерактивный калькулятор или визуализацию на основе вашего запроса. Собственное исследование Google показывает, что это значит для веб-сайтов.

Google завершила августовское спам-обновление 2026 года: что это значит для вашего сайта
Google завершила очередное спам-обновление, начатое 18 августа, 21 августа. Это уже третье подобное обновление в этом году — и оно затрагивает все языки по всему миру.