Дослідники з Тюбінгенського університету, Інституту Макса Планка та інших організацій знайшли спосіб отримувати приховані “сліди міркувань” із передових моделей ШІ. Вони стверджують, що цей метод дозволяє частково відновлювати внутрішній процес, який моделі використовують під час розв’язання складних завдань, пише Wired.
Водночас дослідження показало потенційний ризик витоку конфіденційної інформації та дало нові аргументи в дискусії про можливе копіювання американських ШІ китайськими конкурентами.
Сучасні моделі на кшталт Claude, GPT та Gemini можуть розбивати складне завдання на окремі кроки й послідовно аналізувати їх. Цей процес називають міркуванням або “ланцюжком думок”. Компанії зазвичай не показують його користувачам, оскільки він має комерційну цінність.
Дослідники виявили вразливість у тому, як такі дані передаються через API. Великі моделі часто мають менші версії, які використовують той самий механізм шифрування. При цьому менші моделі проходять менш інтенсивне навчання для дотримання правил поведінки. Передавши їм зашифровані дані про міркування старшої моделі, дослідники змогли розкрити частину прихованої інформації.
В окремих випадках серед отриманих даних були навіть API-ключі та паролі. Дослідники повідомили про проблему OpenAI, Anthropic і Google, після чого компанії внесли зміни до своїх API. Однак повністю усунути можливість вилучення reasoning traces, за словами авторів роботи, набагато складніше.
Найцікавіший результат стосується китайських моделей. Дослідники перевірили 90 запитань і порівняли поведінку різних систем. Особливо помітну схожість вони виявили у китайської моделі Kimi K3 від Moonshot AI з прихованими міркуваннями Claude Opus 4.8 та GPT 5.6 Sol.
Коли Kimi K3 отримувала початкові фрагменти міркувань американських моделей, її подальші відповіді іноді виявлялися дуже схожими. Це може свідчити про використання дистиляції – методу перенесення можливостей однієї моделі на іншу.
Втім, дослідники наголошують, що це не є доказом того, що Kimi K3 була навчена на американських моделях. Інші протестовані системи, зокрема DeepSeek, такої схожості не продемонстрували.
Дослідження також показує, чому дистиляція стала важливим геополітичним питанням. Американські компанії вже звинувачували китайських конкурентів у використанні їхніх моделей для розвитку власних ШІ. Водночас експерти зазначають, що дистиляція є звичайною технологією, яка допомагає швидше та дешевше створювати нові моделі.
Таким чином, робота демонструє, що приховані процеси міркування сучасних ШІ можуть бути менш захищеними, ніж вважалося, а отримана з них інформація потенційно може використовуватися для навчання конкурентних моделей.




