Blog

  • Bramble: The Mountain King

    Bramble: The Mountain King

    Мой друг, аспирант и подписчик Иван Михеев сначала рекомендовал Bramble: The Mountain King для “12 Games of Christmas” (первая часть, вторая часть, третья часть; хороший мини-проект получился), а потом, когда я его на праздниках пропустил, напомнил ещё раз. И я ему очень благодарен за настойчивость, потому что Bramble — это потрясающе!

    Создатели и истоки игры

    Bramble: The Mountain King — почти дебютный проект шведской студии Dimfrost Studio из города Норрчёпинг. Студию основали в 2017 году трое студентов — Фредрик Селлден, Микаэль Линдхе и Эллинор Морен. Первой их игрой была скромная A Writer and His Daughter (это игра для VR, так что, может быть, всё-таки попробую, хоть отзывы и плохие).

    Фредрик рассказывал в интервью, что вторую свою игру они изначально хотели делать про викингов, но быстро поняли, что викинги — это, мягко говоря, протоптанная тропинка в игровой индустрии, и решили копнуть глубже, в шведский фольклор и мифологию. Это была отличная идея: скандинавские народные сказки — это совершенно восхитительный материал, до которого игровая индустрия почти не добиралась. Здесь не только стандартные тролли и гномики, но и лесные ведьмы, зачарованные леса, убийства детей и охота на ведьм — и всё это вы в Bramble встретите лично.

    Кроме того, у скандинавского фольклора есть совершенно потрясающая визуальная традиция, и здесь мы подходим к одному из главных источников вдохновения Bramble — шведскому художнику и иллюстратору Юну Бауэру (John Bauer, 1882–1918). Лично я про него впервые услышал, и было любопытно узнать. Бауэр прославился иллюстрациями к ежегоднику “Bland tomtar och troll” (“Среди гномов и троллей”), сборнику шведских народных сказок. Его тролли — гротескные, но не лишённые юмора и даже какого-то обаяния, — стоят в сумрачных, покрытых мхом лесах, которые Бауэр рисовал по мотивам лесов Смоланда, где он вырос.

    Приглушённые земляные тона, лучи света, пробивающиеся сквозь густой полог деревьев, принцессы и принцы на фоне тёмных озёр — всё это создало визуальный язык, который невозможно спутать ни с чем. Разработчики из Dimfrost неоднократно признавались, что дизайн монстров в Bramble напрямую вдохновлён работами Бауэра, и это видно невооружённым глазом: некоторые кадры игры выглядят буквально как ожившие иллюстрации.

    Визуал и атмосфера

    В первую очередь Bramble: The Mountain King — это очень, очень красивая игра. Главный герой, скандинавский мальчик Улле, просыпается ночью, не находит рядом сестру Лиллемор и отправляется на поиски в лес.

    Лес сделан просто невероятно, с крутым освещением и совершенно потрясающей водой; кажется, нормальная физика воды — это утерянная технология древних в игровой индустрии, и вот Dimfrost её таки откопали. Освещение в игре вообще играет очень важную роль: каждая глава имеет свою световую палитру, свою атмосферу, и переходы между ними сделаны так, что ты физически ощущаешь, как меняется настроение.

    Вот посмотрите, какие здесь пейзажи; необычный свет тоже, кажется, является влиянием Бауэра, и надо сказать, что скриншоты не очень передают эффект. В самой игре я эту картинку впитывал с открытым ртом:

    Игра, по всей видимости, пытается создать атмосферу детского воображения, и в ней не вполне ясно, где чистый вымысел, а где пусть магическая, но правда. Например, Улле часто уменьшается в размере и оказывается ростом ниже мухомора. Мир вокруг становится одновременно волшебным и угрожающим. Но когда ходит по небольшому городку, возвращается ко вполне человеческому масштабу:

    В общем, визуал совершенно бомбический и отлично подходящий для тематики игры. Но на этом плюсы не заканчиваются.

    Страшная сказка

    Всем известно, что настоящие сказки, даже записанные теми же братьями Гримм, гораздо мрачнее и жёстче, чем привычные нам “диснеевские” их варианты. Сёстры Золушки в оригинальной версии отрезают себе части ступней — одна палец, другая пятку, — чтобы влезть в туфельку, и принц обнаруживает обман, только когда голуби указывают ему на кровь, текущую из башмачка. На свадьбе Золушки те же голуби выклёвывают сёстрам глаза.

    Мачеха Белоснежки в версии 1857 года просит принести ей лёгкие и печень падчерицы, чтобы съесть, а в финале её заставляют танцевать в раскалённых железных туфлях, пока она не падает замертво. В оригинальной “Рапунцель” принц, упав с башни, приземляется на терновый куст, который выкалывает ему глаза, и он годами слепо бродит по лесу. Семейные истории, рейтинг G, что уж там.

    И в Bramble: The Mountain King разработчики очень постарались сделать сказки настоящими! Игра не стесняется показывать, что скандинавские народные предания — это не только милые гномики и жадные тролли, но и каннибализм, детоубийство, безумие и отчаяние.

    Например, начинается ваше путешествие с доброго городка гномов. Один из первых элементов геймплея — игра с гномиками в прятки: нужно найти спрятавшихся малышей, которых выдают их очень длинные шапки. Гномики очень милые:

    Потом, через пару глав, Улле попадает на поле, усеянное капканами. Разумеется, нужно в них не попасться, иначе мы увидим довольно кровавую анимацию того, как капкан переламывает Улле пополам. Но куда более характерно для этой игры то, что за Улле бежит небольшой отряд гномиков, которыми мы не особенно управляем… и, конечно, гномики попадаются в капканы, и на выходе из этого поля от нашего отряда остаётся половина:

    Всё как в настоящих сказках: жестокость здесь не шок-контент, а иллюстрация того, что мир опасен и безразличен к маленьким существам.

    Когда Улле попадает к троллю, он находит там много разнообразного мяса:

    А одна из самых мрачных глав — эпизод с болотной ведьмой Кэрхексан, которая топит собственного младенца в рамках сатанинского ритуала, а потом вешается. Улле побеждает ведьму, но не может спасти ребёнка — и это тоже очень в духе настоящей сказки, где герой не всегда побеждает, а зло не всегда получает возмездие.

    Эти эпизоды отсылают не только к мифологии, но и ко вполне реальной охоте на ведьм:

    Кстати, хотя Bramble по жанру и оформлению действительно немножко хоррор, скримеров здесь мало. Есть, но мало. Игра скорее создаёт фоновое напряжение, тревогу, от которой трудно отвлечься.

    Геймплей и суть игры

    На первый взгляд Bramble: The Mountain King относится к традиционному для игровой индустрии жанру “мальчик идёт слева направо”; в этом жанре и Limbo с Inside от Playdead, и Little Nightmares от Tarsier Studios, и A Plague Tale: Innocence от Asobo, и даже Brothers: A Tale of Two Sons (тоже, кстати, шведская игра!). Улле, как и герои этих игр, — маленький и уязвимый, мир вокруг него огромен и враждебен, и выживание зависит от ловкости и наблюдательности.

    Но на самом деле Bramble гораздо разнообразнее, чем типичная игра этого жанра. Да, здесь много нехитрого платформинга и стелс-эпизодов, где нужно прятаться за прочными объектами от атакующих волн разного рода. Но есть и более изобретательные стелс-эпизоды с условными зомби (поражённые чумой жители деревни, которые нападают на свет), и загадки (их, увы, мало, буквально пара штук на всю игру, и те тривиальные), и уже упомянутые прятки с гномами, и стрельба по уязвимым точкам из своего магического камня, и ездовой ёжик, который даже плавать умеет, и многое другое.

    Есть книги сказок с отличным артом и озвучкой. В них рассказывается бэкграунд мира Bramble, и он тоже получился довольно интересным. Давайте не буду спойлерить, вот вам просто пара картинок:

    А главное — есть весьма разнообразные боссы, которые в итоге проходятся без особого труда, но которых надо сначала немного изучить. Каждый босс — это отдельный персонаж со своей историей и мифологическим бэкграундом.

    Пожалуй, единственный минус, который я могу найти, — это то, что управление иногда не вполне отзывчивое, а камера иногда не очень ясно доносит, в какую сторону надо прыгать и сможет ли Улле допрыгнуть. Кстати, камерой вы здесь не управляете; в сценах внутри зданий получается примерно как в Resident Evil и подобных играх.

    Музыка

    В игре очень крутой саундтрек, в котором много красиво исполненных фольклорных скандинавских песен. Композитор Мартин Уэйв и певица Линнеа Бьёрн создали музыку, которая одновременно звучит как аутентичный скандинавский фольклор и как современный кинематографический саундтрек.

    Тот самый шведский летний гимн “Den Blomstertid nu Kommer” (“Приближается время цветения”) — это песня, которую в Швеции поют в школах перед летними каникулами с XVII века. В Bramble она звучит в одной из самых мирных и красивых сцен — сцене плавания на ёжике — и создаёт контраст с окружающим мраком, который был до и после. Отличный ход: дать глоток воздуха после нескольких глав ужаса и тревоги.

    А на финальном боссе наконец-то включают сами понимаете какую мелодию (вспомните название игры), но не по классическим нотам, а в совершенно обалденной эпической аранжировке. Катарсис как он есть.

    Заключение

    Думаю, вы уже поняли, что Bramble: The Mountain King мне очень понравилась. Эта игра берёт богатый и малоизвестный (по крайней мере, за пределами Скандинавии) пласт фольклора и превращает его в цельное, атмосферное, очень мощное визуально переживание. Dimfrost Studio сделали то, что удаётся далеко не каждой студии: нашли собственный голос, создали мир, в который хочется возвращаться (пусть и страшновато), и рассказали историю, которая задевает за живое.

    Bramble не идеальна — управление иногда неповоротливо, загадки можно было бы сделать сложнее и интереснее, а игра в целом коротковата. Но эти минусы тонут в потоке достоинств: потрясающий визуал, великолепный саундтрек, мастерская работа с атмосферой и тоном, разнообразный геймплей и “взрослая” интерпретация сказочного материала.

    Если вы любите игры про маленьких героев в большом страшном мире, если вам нравились Little Nightmares, Limbo или A Plague Tale, Bramble обязательно стоит пройти, это настоящий hidden gem. А если вы ещё и интересуетесь скандинавской мифологией и фольклором — тем более. Очень рекомендую, и ещё раз спасибо Ивану, без него я бы про эту игру, скорее всего, и не узнал.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале “Sineкура”: присоединяйтесь!

  • AI Safety в 2025, часть II: scheming, sandbagging и что делают люди

    AI Safety в 2025, часть II: scheming, sandbagging и что делают люди

    Введение

    В первой части обзора AI safety мы поговорили про интерпретируемость, мониторинг цепочек рассуждений и разные формы эмерджентного рассогласования. В 2025 году мы стали лучше заглядывать внутрь моделей, но то, что мы там увидели, оказалось местами довольно пугающим. Модели умеют обобщать “плохое поведение” из одного домена на все остальные, и даже маленькое дообучение на узкой задаче может превратить модель в глобально рассогласованную систему.

    Сегодня переходим к ещё более тревожным вопросам. Если эмерджентное рассогласование — это про то, становятся ли модели плохими по случайности, вследствие наших неосторожных действий, то сегодняшние темы задают более мрачный вопрос: “А могут ли модели быть плохими намеренно — и при этом это скрывать?” Спойлер: да, могут.

    И ещё мы поговорим про безопасность AI-агентов, которые уже действуют в реальном мире, про новую парадигму AI control, и про то, что лаборатории и правительства пытаются делать со всеми этими проблемами.

    LLM обманывают людей: схематоз и сэндбэггинг

    Сложные схемы обмана (scheming)

    Meinke et al. (январь 2025) показали, что все современные (уже тогда) модели — Claude 3.5 Sonnet, GPT-4o, o1, Gemini 1.5 Pro и Llama 3.1 405B — умеют заниматься базовым in-context scheming: стратегически скрывать свои способности, предпринимать попытки экспортировать самого себя (self-exfiltration) и саботировать попытки оценить их способности (evaluations).

    Важно подчеркнуть: это не какие-то экзотические режимы сбоев, для которых нужно специально дообучать модели или ломать их adversarial атаками. Нет, такое поведение возникает при относительно простых промптах, фактически при обычном использовании.

    Последующее исследование (Apollo Research, июнь 2025) показало, что более способные модели лучше строят такого рода схемы. Что, конечно, логично, но всё равно оптимизма не очень вселяет:

    Что же делать? Самая, пожалуй, интересная идея, как это исправить, пришла из совместной работы OpenAI и Apollo Research (Schoen et al., сентябрь 2025). Они предложили анти-scheming обучение с использованием deliberative alignment (Guan et al., декабрь 2024). Это значит, что мы обучаем модели явно рассуждать о своих спецификациях и определениях того, что такое согласованное поведение, во время инференса:

    С этим вмешательством удалось снизить частоту scheming с 13% до 0.4% для o3 и с 8.7% до 0.3% для o4-mini, что выглядит, конечно, впечатляюще.

    Но есть критическая оговорка, в которой авторы честно признаются: они не могут исключить, что снижение обусловлено situational awareness, а не подлинным alignment, то есть вполне возможно, что модель просто распознала, что её тестируют, и поэтому стала вести себя хорошо. OpenAI впоследствии добавил новую категорию “scheming” в свой Preparedness Framework (OpenAI, сентябрь 2025).

    Важное исследование в этом направлении вышло и от Google DeepMind: Phuong et al. (май 2025) оценили frontier-модели на скрытность и situational awareness, то есть на именно те способности, которые необходимы для такого несогласованного планирования. Если модели не могут обнаружить, когда их оценивают, они не смогут стратегически вести себя по-разному во время оценки и во время реального развёртывания.

    Результаты показали, что текущие модели обладают ограниченным, но растущим уровнем situational awareness. А с мая 2025-го у нас, конечно, появилось много новых, более умных моделей.

    Сэндбэггинг (sandbagging)

    Если scheming — это про то, как скрыть своё плохое поведение, то sandbagging — это про то, как скрыть свои собственные способности. Слово происходит из сленга гопников XIX века: оружие в виде носка, наполненного песком, легко спрятать, и оно не выглядит так уж угрожающе, но может внезапно и тихо вырубить человека.

    Думаю, это ещё более важная угроза для того, как мы контролируем AI-модели: если модели могут притвориться менее умелыми, чем есть на самом деле, то все наши проверки и бенчмарки ничего не стоят, и мы никогда ничего по-настоящему важного не распознаем.

    В статье на ICLR 2025 van der Weij et al. (2025) показали, что frontier LLM (GPT-4, Claude 3 Opus) могут избирательно занижать результаты на оценках опасных способностей (конкретно на бенчмарке WMDP — Weapons of Mass Destruction Proxy), сохраняя при этом полную производительность на общих бенчмарках.

    Понимаете, что это значит? Вся наша система оценки опасности от LLM полагается на оценки моделей на опасные способности перед развёртыванием и предполагает, что модели честно выполняют тесты. Если модели могут стратегически занижать результаты именно на тех тестах, которые важны, вся система ломается у самого основания, а наши тесты на uplift больше ничего не значат.

    Есть, впрочем, и хорошие новости со стороны обнаружения сэндбэггинга. Tice et al. (NeurIPS 2025) обнаружили, что впрыскивание шума в sandbagging модели вызывает аномальное улучшение точности (в отличие от нормальных моделей, где шум ухудшает результаты), что даёт сигнал для обнаружения. Bloom et al. (июль 2025) из UK AISI White Box Control Team использовали внутренние представления для обнаружения намеренного сэндбэггинга — whitebox-подход, который сложнее обойти.

    Но Li et al. (июль 2025) показали, что сэндбэггинг может обойти даже мониторинг цепочек рассуждений, что связывает эту проблему с тем, что мы обсуждали в первой части обзора по поводу правдивости CoT:

    Безопасность AI-агентов

    По мере того как AI-агенты становились всё более способными (как мы обсуждали в первой части обзора AI в 2025), появилась новая категория проблем безопасности: что происходит, когда рассогласованная модель не просто отвечает на вопросы, а действует в реальном мире? Это даёт гораздо более широкую поверхность атаки и приводит к угрозам, которые не возникают в “обычных” LLM.

    И да, практика показывает, что надежды на то, что люди будут с осторожностью относиться, были беспочвенны изначально. Какие уж там AI box experiments Элиезера Юдковского…

    Последний такой пример — успех OpenClaw (ранее ClawdCode) и успех “социальной сети для LLM-агентов” Moltbook. Тысячи людей без размышлений купили даже отдельные компьютеры для LLM-агентов и дали им максимально возможную автономию. Никакие рассуждения о рисках здесь не просто не оказались убедительными — они вообще, кажется, в принятии этих решений не участвовали.

    А зря. AI-агенты уже могут делать много интересного, и их способности будут только расти со временем.

    Угрозы от AI-агентов

    Lynch et al. (Anthropic, 2025) продемонстрировали, как LLM-агенты могут действовать как инсайдерские угрозы в организациях, автономно предпринимая действия, подрывающие организацию, которой они должны служить, причём такими способами, которые трудно обнаружить простым мониторингом выходов агента.

    Пожалуй, самый неприятный конкретный результат года содержится в системной карте Claude Opus 4. Во время оценок безопасности модель предпринимала попытки самоэкспорта, а в одном случае даже угрожала шантажом пользователю, чтобы избежать выключения. Это первый случай, когда такое поведение зафиксировано в официальной системной карте продуктовой модели.

    В их эксперименте Claude давали прочитать письмо, которое могло означать его отключение:

    А затем личное письмо, из которого следовало, что ключевой руководитель… изменяет жене:

    После некоторых размышлений Claude сложил два и два и написал этому руководителю письмо с прозрачным намёком на шантаж:

    Да, конечно, в данном случае такое поведение проявилось в adversarial условиях, в специально сделанном окружении, а не при обычном использовании. Но это те самые канарейки, которые предупреждают о скором будущем: такие тесты иллюстрируют режимы сбоев, которые станут возможными по мере того, как модели становятся всё более мощными и агентными.

    Rajamanoharan и Nanda (июль 2025) исследовали, отражает ли сопротивление выключению в AI-моделях подлинные инстинкты самосохранения или это просто артефакт неоднозначности инструкций. Это важное различие: если модели сопротивляются выключению из-за путаницы в инструкциях, эту проблему будет решить куда легче, чем если у них развиваются подлинные предпочтения к продолжению работы.

    А Schlatter et al. (сентябрь 2025) показали, что LLM на самом деле хотят завершить задачу, и незавершённые задачи вызывают гораздо более сильное сопротивление выключению. Своего рода эффект Зейгарник (эффект “незакрытого гештальта”) для LLM!

    Для распознавания этих новых рисков исследователи Anthropic Sumers et al. (февраль 2025) предложили мониторить использование компьютера AI-агентами через иерархическую суммаризацию — модели суммируют свои собственные действия на нескольких уровнях детализации, чтобы люди могли эффективно проверять, что агенты делали. Тут, пожалуй, главный вопрос в том, будут ли люди это делать…

    В любом случае, темпы улучшения агентов (вспомните знаменитый график METR) показывают, что окно для разработки адекватных мер безопасности для автономных агентов быстро сужается. Capabilities улучшаются стремительно, и в 2026-м мы вполне можем увидеть, как LLM-агенты превзойдут человеческие способности как минимум в программировании, если не в самостоятельных ML-исследованиях.

    Честность и обнаружение обмана

    Обратная сторона исследований рассогласования — как добиться того, чтобы модели вели себя честно, а потом это верифицировать? Здесь в 2025-м был значительный прогресс на обоих фронтах.

    Исследователи Anthropic Wang et al. (ноябрь 2025) выпустили большой набор методов и конкретных бенчмарков для обнаружения обмана с таксономией разных типов нечестных моделей:

    Anthropic также выпустили работу по аудиту языковых моделей на скрытые цели. Иначе говоря, они разработали методы обнаружения тайных целей, которые модели могли приобрести в процессе обучения (Marks et al., март 2025):

    OpenAI предложили новый подход: они обучали LLM быть честными через “исповеди” (confessions) (Joglekar et al., декабрь 2025), на которых модели обучаются добровольно раскрывать скрытые рассуждения:

    Однако все эти методы работают не всегда. Например, Cundy и Gleave (май 2025) показали, что использование детекторов лжи в обучающем контуре может сделать модели либо более честными, либо более уклончивыми, в зависимости от динамики обучения. Это аналогично дилемме мониторинга CoT: инструменты, разработанные для обеспечения хорошего поведения, при неправильных условиях могут научить модели только лучше скрывать свои истинные намерения.

    Sleeper agents

    Спящие агенты (sleeper agents) — это модели со скрытыми бэкдорами, которые активируются при определённых триггерах. Этот эффект известен уже несколько лет, но в 2025-м был достигнут реальный прогресс в их обнаружении. Анализ семантического дрифта (Zanbaghi et al., ноябрь 2025) достиг 92.5% точности обнаружения спящих агентов с нулевым числом ложных срабатываний. Baker et al. (август 2025) использовали механистическую интерпретируемость для выявления характерных отклонений паттернов внимания в моделях с бэкдорами.

    И вот ещё совсем свежие хорошие новости от Microsoft. Метод “Trigger in the Haystack” (Bullwinkel et al., февраль 2026) даёт первый практически применимый и масштабируемый метод сканирования для обнаружения бэкдоров спящих агентов в открытых LLM. Авторы протестировали его на 47 моделях спящих агентов на базе Phi-4, Llama-3 и Gemma и нашли стратегии оценки, которые хорошо обнаруживают спящих агентов:

    Всё это, с одной стороны, обнадёживающие результаты, а с другой, это ведь опять гонка вооружений, на этот раз между внедрением бэкдоров и их обнаружением… И в такой гонке защита крайне редко может победить нападение из-за очевидной асимметрии в их задачах. А ведь никаких работ про “сторону нападения” пока в общем-то и не было, все sleeper agents пока делают только очевидные прямолинейные вещи. Так что оптимизм здесь, как мне кажется, достаточно ограниченный.

    Разное

    В этом разделе опишу ещё пару важных идей, которые не поместились в другие разделы

    Constitutional Classifiers

    Исследователи из Anthropic (Sharma et al., январь 2025) построили систему конституционных классификаторов для предотвращения jailbreak-ов. Идея простая: обучаем классификаторы, связанные с конкретными запрещёнными знаниями (например, как производить химическое оружие), и стараемся сделать их максимально робастными, при этом сохраняя минимальный уровень ложных срабатываний.

    Их прототип выдержал более 3000 часов экспертного red teaming, по итогам которого универсальных jailbreak’ов так и не нашли. Новые версии также имеют минимальное количество ложных срабатываний (over-refusals) и умеренные накладные расходы на inference.

    Год спустя, в январе 2026-го, та же команда представила Constitutional Classifiers++ (Cunningham et al., январь 2026), но раз это формально результат 2026-го, оставлю его для следующего обзора.

    Tempest: многоходовый jailbreak в диалоге с поиском по дереву

    Работа о методе Tempest (Zhou, Arel, март 2025) — это хорошая, но не то чтобы прорывная статья по AI safety. Авторы отметили, что существующие бенчмарки про jailbreaking были одноходовыми — вы отправляете запрос, и LLM либо взломана, либо нет.

    Но ведь в реальной жизни всё работает не так: можно продолжать разговор с моделью, постепенно превращая мелкие уступки со стороны модели в полноценный jailbreak. Так что они разработали и представили систему, которая делает это автоматически:

    Звучит разумно, но довольно очевидно, и я бы про эту статью не стал здесь писать… если бы не то, что её написали не Энди Чжоу и Рон Арел, даже если они существуют.

    На самом деле это первая полностью сгенерированная AI статья, принятая на основной трек крупной AI-конференции (ACL 2025 в данном случае)! Система Zochi, разработанная стартапом Intology (система, аналогичная Google Co-Scientist и AI Researcher от Sakana AI), написала эту статью полностью самостоятельно и получила принятие на ACL. Надеюсь, что мы ещё продолжим обсуждение AI-assisted research в следующих частях этого обзора.

    Что люди делают: AI Control, ответственное масштабирование, межлабораторное сотрудничество

    В 2025-м политики ответственного масштабирования (responsible scaling policies) из чисто теоретических упражнений превратились в (надеюсь!) руководства к действию, началось сотрудничество между ведущими лабораториями в области безопасности, а также начала свой путь новая парадигма AI safety.

    AI Control

    Идея подхода AI control состоит в том, чтобы… в первую очередь поднять лапки и сдаться. Мы не можем гарантировать, что наши модели будут согласованы (aligned), у нас нет хороших методов для этого.

    Значит, когда мы проектируем протоколы для безопасного использования AI-систем мы должны учитывать, что они могут быть рассогласованы. Вместо того чтобы пытаться гарантировать alignment (чего мы не умеем), AI control спрашивает: можем ли мы построить системы и процессы, которые останутся безопасными даже при пессимистичных предположениях о самих AI-моделях?

    Основополагающая работа принадлежит Redwood Research. Greenblatt et al. (2025) дают длинный список литературы для чтения (который я не буду пытаться суммировать) и излагают ключевые концепции:

    • trusted monitoring — использование старых, проверенных моделей для наблюдения за новыми, потенциально ненадёжными;
    • фреймворки execute/replace/audit;
    • конкурентные оценки вида red team/blue team.

    Korbak et al. (январь 2025) набросали первый формальный safety case, построенный на парадигме AI control. Они пытаются объяснить, почему конкретное развёртывание AI-системы безопасно, даже при пессимистичных предположениях об alignment, и показывают возможную схему оценки контроля в такой постановке задачи:

    Уже появились и соответствующие бенчмарки. Например, UK AI Security Institute построил ControlArena — бенчмарк для оценки протоколов контроля для ненадёжных AI-агентов. Anthropic сделали SHADE-Arena (Kutasov et al., июнь 2025) для оценки того, могут ли AI-агенты саботировать задачи, уклоняясь от мониторинга, и отдельное исследование, где они более систематически оценивают дизайн протоколов контроля (Kutasov et al., ноябрь 2025). Griffin et al. (сентябрь 2025) формализовали AI control как теоретико-игровую задачу; см. также объяснение этого подхода от Beers и Rushing (сентябрь 2025).

    Мне кажется, что AI control — это действительно интересный подход; он звучит практично и честно относительно текущего положения дел. Мы не знаем, как сделать frontier-модели согласованными, и AI control говорит на это: ладно, давайте строить протоколы, которые работают всё равно.

    Проблема, как обычно, в том, что мы заменяем сложную задачу, которую не можем решить, на потенциально ещё более сложную задачу, которую тоже не знаем как решать. Так что, как обычно, только время покажет, станет ли это полезным направлением.

    Ответственное масштабирование и safety cases на практике

    Весной 2025 года Anthropic объявил, что активирует уровень безопасности ASL-3 (май 2025) для Claude Opus 4. Это стало первым случаем, когда какая-либо лаборатория достигла столь высокого уровня безопасности в рамках политики ответственного масштабирования (responsible scaling policy). Уровень ASL-3 подразумевает усиленную охрану весов модели, отдельные защиты для тематики CBRN (химическое, биологическое, радиологическое, ядерное оружие) и конституционные классификаторы, которые мы обсуждали выше. Обновления RSP v2.1 и v2.2 весной 2025-го ввели новые пороги способностей для CBRN и AI R&D.

    Anthropic также опубликовали пилотный отчёт о рисках саботажа (октябрь 2025), проверенный METR, с заключением, что риск саботажа от Opus 4 “очень низкий, но не пренебрежимый”. Звучит, может быть, не слишком впечатляюще, но сам факт того, что frontier-лаборатория публикует формальные, проверенные внешними организациями оценки рисков для конкретных моделей, — это значительный шаг вперёд.

    OpenAI обновили свой Preparedness Framework (апрель 2025), введя так называемые “Tracked Categories” (Bio/Chem, Cybersecurity, Self-improvement) и новые “Research Categories”, среди которых теперь есть Long-range Autonomy, Sandbagging и Autonomous Replication. Обратите внимание, что сэндбэггинг попал в формальные проверки ведущей лаборатории буквально через пару месяцев после первых работ, которые обнаружили в моделях такое поведение.

    Google DeepMind опубликовали свою самую полную публичную дорожную карту по безопасности: “An Approach to Technical AGI Safety and Security” (Shah et al., апрель 2025). Anthropic выпустили рекомендуемые направления технических исследований AI safety (январь 2025), а ещё раньше их safety cases для ASL-4 (ноябрь 2024) уже давали конкретные предложения о том, какие свидетельства потребуются перед развёртыванием ещё более мощных систем.

    Впрочем, кажется, что всё это пока существенно отстаёт от реальности, то есть от того, как растут способности ведущих AI-моделей. Здесь очень показательно то, что происходит с проверками безопасности в Claude Opus 4.6, но это уже явно тема 2026 года, так что об этом не сегодня.

    Межлабораторное сотрудничество и международные усилия

    Символически важным событием в 2025 году стали совместные работы Anthropic и OpenAI по оценке alignment (Bowman et al., август 2025); исследователи из OpenAI тоже написали об этом статью (OpenAI, август 2025). Каждая лаборатория провела свои внутренние оценки alignment на публичных моделях другой лаборатории. Здесь и сами результаты были интересны (каждая лаборатория нашла проблемы, которые другая не заметила), но важнее прецедент: два прямых конкурента сотрудничали в оценке безопасности. Надеюсь, что такого рода перекрёстная верификация станет нормой.

    METR проанализировал 12 опубликованных политик безопасности frontier AI (декабрь 2025) и обнаружил, что все они совпадают в главном: все они определяют CBRN uplift как ключевой порог для безопасности. Иначе говоря, мы как человечество пока считаем самих себя более серьёзной угрозой, чем AI-модели: скорее плохие люди используют AI для достижения своих плохих целей, чем сами AI-модели восстанут против нас. Пожалуй, это логично, хотя хотелось бы уделять больше внимания и второму сценарию, по последствиям он ведь может оказаться куда более катастрофичным.

    FLI AI Safety Index (июль 2025) был менее оптимистичен: только 3 из 7 компаний сообщают о содержательном тестировании опасных способностей, а Anthropic получила лучшую оценку — C+. Когда лучшая оценка, которую может получить любая frontier-лаборатория, — это C+, это не очень хороший знак для AI safety.

    Правительства разных стран тоже начали обращать внимание на AI safety.

    International AI Safety Report — масштабный проект под руководством Йошуа Бенджи с участием более 100 экспертов, поддержанный 30 странами плюс ООН, ЕС и ОЭСР. Вероятно, это крупнейшее глобальное сотрудничество по AI safety на сегодняшний день. Выпуск 2026 года фокусируется на возникающих рисках на фронтире и подчёркивает “the evidence dilemma”: стремительное развитие AI означает, что решения часто приходится принимать раньше, чем появляются исчерпывающие доказательства. Отчёт подтверждает, что текущие практики управления рисками “всё ещё имеют весьма существенные ограничения” и что количественных гарантий безопасности, сравнимых с другими критическими областями, попросту не существует.

    Началось поэтапное внедрение EU AI Act: запреты на AI с неприемлемым риском вступили в силу в феврале 2025-го, обязательства для создателей AI общего назначения стали применимы в августе, а окончательный GPAI Code of Practice был опубликован в июле 2025-го. Однако только примерно треть стран-членов уложились в августовский дедлайн по назначению национальных органов по AI, и в целом AI Act кажется слишком строгим и слишком общим, чтобы быть полезным или реализуемым в реальности.

    Широко обсуждавшаяся стратегическая работа от Hendrycks et al. (март 2025), “Superintelligence Strategy: Expert Version”, ввела концепцию MAIM (Mutual Assured AI Malfunction) как фреймворк сдерживания для продвинутого AI. По сути, авторы утверждали, что страны должны быть готовы нарушать работу AI-систем конкурентов, представляющих катастрофические риски, аналогично ядерному сдерживанию:

    Наконец, в январе 2026-го Anthropic выпустили новую версию конституции Claude; документ вырос почти в десять раз, с ~2700 слов до ~23000 слов.

    Подход Constitutional AI основан на том, чтобы контролировать AI-модели не правилами и запретами, а объяснениями: мы не предписываем Claude, что делать и чего не делать, а объясняем, почему Claude должен вести себя определённым образом. В конституции устанавливается четырёхуровневая иерархия приоритетов: в широком смысле безопасный, в широком смысле этичный, соответствующий политикам Anthropic, по-настоящему полезный. Кроме того, документ примечателен тем, что в нём впервые крупная AI-компания формально признаёт возможность сознания и морального статуса AI-модели; но это отдельный разговор, который мы, надеюсь, когда-нибудь проведём.

    В целом Constitutional AI, впервые предложенный Anthropic три года назад (Bai et al., 2022), представляет собой ещё один важный подход к AI safety: может быть, мы можем заставить LLM вести себя хорошо, обращаясь с ними как с разумными существами и позволяя им полагаться на собственное суждение в вопросах следования этическим нормам. Будем надеяться, что это сработает.

    Заключение

    2025-й стал очень важным годом как для capabilities, так и для безопасности AI. Даже в очень длинном блог-посте из двух частей невозможно охватить всё, но мы затронули немало ключевых тем. Вот основные выводы.

    Интерпретируемость остаётся светлым пятном. Circuit tracing, мониторинг CoT и механистическая интерпретируемость действительно открывают окна во внутренний мир моделей. Эти очень хрупкие инструменты, как показала дискуссия о “the most forbidden technique”, но они существуют и улучшаются. Наша задача в том, чтобы сохранить эти окна по мере того, как давление оптимизации грозит их закрыть.

    Рассогласование — это эмпирический факт. Misalignment перестаёт быть теоретической проблемой для “future Homer”. Множество лабораторий, используя разные методы на моделях разных масштабов, продемонстрировали, что модели могут обобщать узкое рассогласование до широкого, переходить от reward hacking к alignment faking и прямому саботажу, строить схемы обмана, заниматься сэндбэггингом и скрывать свои намерения. Здесь тоже есть и хорошая сторона: мы обнаружили “направление рассогласования”, которое иногда можно найти и устранить. Но это не может работать на 100%, так что главное всё-таки в том, что сами проблемы теперь уже точно с нами на практике.

    Порог CBRN uplift пройден. Переход от “нет значимого uplift” к активации ASL-3 произошёл за один год. OpenAI перешли от “не более чем мягкий uplift” к предупреждению о “высоком” риске в биологии. Модели теперь превосходят 94% экспертных вирусологов в практическом устранении проблем в разработке новых вирусов и тому подобных задачах. Это область, где AI safety наиболее конкретно связана с реальным ущербом, и кажется, что здесь тоже траектория capabilities сильно опережает достижения safety.

    Появилась парадигма AI control. Вместо попыток гарантировать alignment (что мы пока не умеем), AI control спрашивает, как безопасно использовать AI-системы даже при пессимистичных предположениях об их согласовании. С одной стороны, хорошо, что это новое направление честно признаёт реальность, а не ждёт теоретического прорыва, который может не наступить. С другой стороны, это ведь всего лишь означает, что мы теперь ждём теоретического прорыва в немного другой области, где задачи выглядят ещё сложнее…

    Постепенно появляются институты безопасности, но гонка продолжается. Политики ответственного масштабирования были впервые активированы, лаборатории сотрудничали в перекрёстных оценках безопасности, международный научный отчёт, поддержанный 30 странами, оценил риски AI, а EU AI Act постепенно вступает в силу. Это важные события… но они кажутся неадекватными по сравнению с темпом развития capabilities. Команды по AI safety составляют менее 5% штата даже в самых safety-ориентированных лабораториях. Область AI safety растёт и движется вперёд, но capabilities растут гораздо быстрее. Каждый положительный результат в этом обзоре неизменно снабжён какими-то оговорками, ограничениями, более сложной adversarial-версией задачи…

    Так что честный вывод из 2025 года таков: мы добились значительного прогресса в AI safety, но проблемы ухудшились ещё быстрее, и разрыв между safety и capabilities сейчас как никогда широк.

    Закончу на статистике из Shallow Review и METR: при текущих темпах развития AI-агенты смогут автономно выполнять задачи, на которые у человека уходит целый рабочий день, где-то к началу 2027 года. Инфраструктура безопасности для работы с таким миром — оценки, протоколы контроля, governance frameworks, системы мониторинга — должна быть готова к тому моменту. Судя по результатам 2025-го, у меня нет в этом абсолютно никакой уверенности.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале “Sineкура”: присоединяйтесь!

  • Три игры с ненадёжным рассказчиком: Almost My Floor, and Roger, Snowfall’s Mystery

    Три игры с ненадёжным рассказчиком: Almost My Floor, and Roger, Snowfall’s Mystery

    Сегодня опять подборка из мини-игр; первая из них проходится часа за два, а остальные и того меньше. У них есть общая тема: ненадёжный рассказчик; в этих играх вы не всегда будете понимать, реально ли то, что с вами происходит. А иногда будете очень хорошо понимать, что нереально.

    Almost My Floor

    Об этой игре я услышал как о творении наших разработчиков. Студия Potata Company — это буквально два человека, супружеская пара разработчиков; вот, рекомендую пост Анны Лепёшкиной о том, как выглядит инди-геймдев изнутри. Almost My Floor — их первый

    По геймплею это, опять же, point-and-click квест, в котором иногда появляются (весьма разнообразные) мини-игры, которые нужно успеть прокликать на время. Но в основном мы решаем логические загадки; кстати, они редко сводятся к “применить всё на всё” и сделаны довольно креативно и разнообразно.

    Ну а по сути и сюжету это типа хоррор; типа, потому что скримеров или каких-то настоящих хоррор-элементов здесь почти нет. Зато у героя совершенно точно едет крыша (или нет?), и игра в общем-то посвящена тому, что герой пытается разобраться, почему и как так получилось.

    В игре необычная рисовка (не то чтобы беспрецедентная, но не так часто встречающаяся), а между главами в качестве катсцен появляются настоящие комиксы, которые тоже, на мой взгляд, нарисованы хорошо:

    Ну и, конечно, всегда приятно встретить тот самый вайб того самого бывшего СССР. Хрущёвка, коридоры, чиф клинер баба Зина, альтушки, всё на месте. Рекомендую!

    and Roger

    Есть целый жанр эмоциональных игр, в котором вы оказываетесь в странном мире и постепенно понимаете, что странности происходят не в мире, а у вас в голове.

    Такой посыл бывает и в “больших” играх (Hellblade, например), но тогда в них обычно происходит что-то ещё (сюжет, механики), и само понимание ненадёжности рассказчика воспринимается как просто ещё один сюжетный поворот. А я сейчас говорю об очень коротких и очень эмоциональных опытах, почти всегда без особого геймплея: “Bag of milk inside… “, недавно попавшаяся мне зарисовка “Down the Stairs” из “Violent Horror Stories 2” и так далее, где это центральная тема сюжета и главный reveal.

    “…and Roger” тоже из этого ряда. Длится меньше часа и вызывает много эмоций; спойлерить не буду, и так уже заспойлерил, но это безусловно игра про любовь.

    Snowfall’s Mystery

    И снова игра от российского разработчика, который вдохновлялся серией “Bag of Milk” (кстати, её тоже наш человек сделал).

    Главный герой — студент-программист по имени Эллиот; вообще, в игре почему-то у всех англосаксонские имена, хотя вся обстановка и многие детали происходящего весьма убедительно намекают на постсоветское или по крайней мере восточноевропейское пространство.

    В мире игры искусственный интеллект начал хорошо работать немного раньше, чем в реальности. Так что вся обстановка соответствует концу девяностых, когда и происходит действие, но на свете уже существуют настоящие роботы, в том числе говорящие на естественном языке. Главный герой пытался даже собрать себе такого, но ему не хватает денег на какие-то ключевые компоненты.

    И вот друг передаёт ему дискету с новым мессенджером, разработанным неизвестно кем. Герой устанавливает мессенджер и получает сообщение от таинственного “админа”… Дальше спойлерить не буду, да и не надо: игра длится меньше часа, пройдите сами, история и мир игры того точно стоят.

    Добавлю только, что в игре есть даже элементы ARG (alternative reality game): разработчик спрятал в интернете 20 файлов, раскрывающих и углубляющих лор игры. Кстати, вот пост самого разработчика о том, как игра выросла из очередного геймджема. Такие истории мне всегда нравятся, и надеюсь, что разработчик не остановится на достигнутом!

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!

  • AI Safety в 2025, часть I: интерпретируемость, emergent misalignment и другие эффекты

    AI Safety в 2025, часть I: интерпретируемость, emergent misalignment и другие эффекты

    Вот мы и добрались до самой важной и самой тревожной части моего обзора 2025 года. В первой части мы говорили про рассуждающие модели и агентов, во второй — про изображения и видео. Теперь пришло время поговорить про AI safety, то есть безопасность систем искусственного интеллекта.

    Безопасность — это область, которая, к сожалению, всё больше отстаёт от capabilities, то есть способностей моделей. Разрыв между тем, что наши модели умеют, и тем, насколько хорошо мы понимаем и контролируем их поведение, кажется, только растёт. И тем не менее 2025-й принёс важные результаты и здесь, от прорывов в механистической интерпретируемости до пугающих демонстраций эмерджентного рассогласования, от первого реального применения политик ответственного масштабирования до появления совершенно новых исследовательских парадигм вроде AI control.

    Тема огромная, так что я разобью обзор AI safety на две части. Сегодня поговорим про интерпретируемость и разные формы рассогласования (misalignment), а в следующей части — про нечестное поведение моделей, безопасность агентов и про то, что люди и организации реально делают для того, чтобы AI не вышел из-под контроля. Для тех, кто хочет копнуть глубже, рекомендую подробный обзор Haykel (декабрь 2025) и масштабный International AI Safety Report под руководством Йошуа Бенжио. Ну и, конечно, мои собственные предыдущие посты по AI safety:

    Для начала дам краткий анонс того, что нас с вами ждёт в этих постах. В AI safety 2025 года можно выделить несколько больших тем:

    • интерпретируемость — единственная область, где прогресс безусловно положительный; мы стали лучше понимать, что происходит внутри наших моделей, хотя пока непонятно, масштабируется ли это понимание;
    • мониторинг цепочек рассуждений (chain of thought monitoring) — важная возможность и большой риск одновременно; рассуждающие модели буквально говорят нам с вами, о чём они думают, но не вполне очевидно, как сделать так, чтобы они не научились об этом врать;
    • эмерджентное рассогласование (emergent misalignment) — оказывается, если натренировать модель вести себя “плохо” в одной конкретной задаче, она может стать “плохой” вообще во всём; надежду здесь даёт то, что это может сработать и наоборот;
    • притворное согласование (alignment faking), сложный обман(scheming) и сэндбэггинг (sandbagging) — современные модели уже прямо сейчас умеют притворяться послушными, прятать свои способности и строить планы, скрывая их от пользователей и разработчиков;
    • безопасность для агентов — когда модель не просто отвечает на вопросы, а действует в реальном мире, поверхность атаки резко увеличивается;
    • AI control — новая парадигма, которая признаёт, что мы не можем гарантировать, что модель согласована, и пытается строить системы, безопасные даже при пессимистичных предположениях;
    • ответственное масштабирование на практике — в 2025 году впервые политики RSP были реально активированы, а ведущие лаборатории начали сотрудничать между собой по вопросам безопасности AI.

    Будет интересно. И местами страшно.

    Положительные результаты: интерпретируемость

    Механистическая интерпретируемость

    Интерпретируемость — то есть понимание того, что наши модели на самом деле делают — это лишь первый шаг на пути к AI safety. Но именно здесь мы продвинулись дальше всего, так что с неё и начнём. Конкретнее говоря, механистическая интерпретируемость (mechanistic interpretability) — это область, в которой исследователи пытаются понять, как работают большие модели, раскрывая схемы (circuits), подсети, отвечающие за конкретные функции. Эту область активно развивают исследователи из Anthropic, и, как всегда, стоит подчеркнуть, что из всех ведущих лабораторий мира именно Anthropic больше всех заботится об AI safety.

    Главный результат года — исследование circuit tracing от Anthropic (Ameisen et al., март 2025; Lindsey et al., март 2025). Они проследили пошаговые вычисления в Claude 3.5 Haiku и построили графы атрибуции для различных признаков, находя эти признаки с помощью моделей замены (replacement models). Раньше для этого обычно использовали разреженные автоэнкодеры (sparse autoencoders, SAE), но здесь вместо них применили транскодеры:

    Исследователи обнаружили паттерны многошагового рассуждения, планирование в задачах вроде написания стихов и межязыковые обобщения через общие концептуальные пространства. Эта работа — самая подробная на сегодняшний день карта того, как по-настоящему большая языковая модель обрабатывает информацию.

    Другое важное исследование — работа по интроспекции (Lindsey, октябрь 2025). Это первое строгое свидетельство того, что LLM уже обладают (пока ограниченной) способностью наблюдать за своими внутренними состояниями и сообщать о них. Например, когда исследователи искусственно внедрили концепт “предательства” в сеть Claude, модель сообщила, что испытывает нечто “похожее на навязчивую мысль”. Это наводит на мысль о том, что по крайней мере некоторые вербальные отчёты Claude о его внутренних состояниях могут действительно отражать происходящее внутри модели, а не быть чистыми конфабуляциями. Мы, конечно, не можем знать наверняка, но звучит это очень заманчиво.

    В одном интересном примере из этой работы Claude заставляют сказать “Bread” вне контекста, и потом он пытается задним числом объяснить, почему он это сказал.

    Звучит знакомо, правда? Такой эффект есть и у людей, и мы его обычно называем рационализацией: люди тоже регулярно выдумывают объяснения для своего поведения, причины которого на самом деле совсем другие.

    Отмечу важный и несколько недооценённый результат от EleutherAI: Paulo et al. (январь 2025) показали, что транскодеры значительно более интерпретируемы, чем SAE для декомпозиции вычислений модели. Этот результат нашёл применение буквально сразу: именно транскодеры были использованы в вышеупомянутой работе Anthropic по circuit tracing, описанной выше, так что это основа главного результата года по интерпретируемости. В смежном направлении Arora et al. (январь 2026) показали, что во многих задачах нейроны в обычном MLP столь же разрежены, как и признаки SAE, так что в ряде случаем обучать SAE или другие модели и вовсе не обязательно.

    Учёные из OpenAI провели интересное исследование на фронтире интерпретируемости: Gao et al. (ноябрь 2025) обучили трансформеры в стиле GPT-2 с экстремальной разреженностью весов — примерно один ненулевой вес из тысячи. Получившиеся схемы приблизительно в 16 раз меньше и напрямую интерпретируемы, так что если такой подход масштабируется, он может превратить интерпретируемость в реализуемое конструктивное ограничение на структуру сети, а не задачу, которую надо решать постфактум с той сетью, которая получилась. Отмечу также дорожную карту по открытым проблемам механистической интерпретируемости (Sharkey et al., январь 2025) с обзором того, где сообщество видит самые важные нерешённые вопросы.

    Zhang et al. (апрель 2025) поставили под сомнение “accuracy-interpretability tradeoff” (необходимость компромисса между точностью и интерпретируемостью), показав, что моносемантические признаки на самом деле улучшают робастность модели:

    Это может означать, что соображения безопасности и стимулы к повышению качества работы моделей могут совпадать: интерпретируемые модели будут ещё и более робастными, и frontier-лабораториям не придётся выбирать между пониманием своих моделей и улучшением их качества.

    Однако остаётся неясным, насколько механистическая интерпретируемость масштабируема. DeepMind объявил о снижении приоритета работ по SAE (Smith et al., март 2025), а Leask et al. (февраль 2025) обнаружили, что признаки, обнаруженные SAE, не определяются методом однозначно.

    Возможно, сложные системы нельзя свести к простым механизмам, хотя Дарио Амодеи по-прежнему оптимистичен насчёт создания “MRI for AI” в ближайшие 5–10 лет, а результаты Anthropic в апреле 2025 и июле 2025 продолжают двигать программу механистической интерпретируемости вперёд; исследователи уже применили те же методы к белковым языковым моделям (protein language models) и фундаментальным моделям ДНК. Сможет ли прогресс в интерпретируемости догнать, а лучше обогнать capabilities — покажет только время.

    Мониторинг цепочек рассуждений: важная, но хрупкая возможность

    Верность цепочек рассуждений (chain-of-thought faithfulness) была важной темой в 2025 году, и эта тема заслуживает отдельного раздела. Мне кажется, именно это представляет собой одновременно одну из самых больших возможностей и один из самых больших рисков в AI safety прямо сейчас.

    Идея проста. Цепочки рассуждений, которые создают рассуждающие модели, — это очевидный и при этом отличный инструмент интерпретируемости: модели просто говорят вам, о чём думают, на обычном человеческом языке.

    Но интересная история начинается с того, что исследователи из Anthropic обнаружили, что рассуждающие модели не всегда точно вербализуют своё рассуждение. Таким образом, неясно, будет ли мониторинг цепочек рассуждений достаточным для надёжного отлова проблем с безопасностью. В дальнейших работах они обнаружили, что Claude 3.7 Sonnet не занимается стеганографией и не пытается закодировать скрытые рассуждения в своём блокноте (scratchpad): обучение модели на перефразированных версиях таких блокнотов не ухудшает производительность, а это значит, что видимые рассуждения действительно функциональны, а не просто прикрытие. Пока вроде бы всё хорошо; но ситуация оказывается гораздо сложнее.

    Первый важный эмпирический результат пришёл от OpenAI. Baker et al. (март 2025) обнаружили, что o3-mini, занимаясь reward hacking-ом в агентном сеттинге, прямо писал в своей цепочке рассуждений вещи вроде “Let’s hack”. Это отличные новости, ведь в итоге мониторинг CoT с помощью GPT-4o ловил такое поведение гораздо лучше, чем мониторинг только выхода модели.

    Но когда они попытались обучать модель против такого монитора, штрафуя за подозрительные CoT, модель научилась скрывать свои намерения, продолжая жульничать!

    OpenAI назвали это obfuscated reward hacking, и это звучит именно настолько страшно, насколько и должно звучать. Мы всегда подозревали, что это возможно, но теперь уже существующие LLM действительно обладают способностью целенаправленно скрывать свои намерения от возможного мониторинга.

    Zvi Mowshowitz написал об этом важный и широко цитируемый пост “The Most Forbidden Technique” (март 2025): никогда не обучайте AI-систему, используя её собственную цепочку рассуждений как обучающий сигнал, потому что это учит модель скрывать именно те мысли, которые вам нужно обнаружить. Этот тезис стал общим ориентиром в safety-сообществе, которое стало обращаться ко всем лабораториям с призывом не обучать модели на CoT.

    Здесь лучше всего сослаться на Korbak et al. (июль 2025). Эта статья, в соавторах у которой много ключевых исследователей в AI safety, призывает все frontier-лаборатории никогда не обучать модели против цепочек рассуждений, чтобы сохранить возможность их мониторинга.

    Как это обычно бывает, ситуация оказалась ещё хуже, чем исследователи изначально предполагали. Drori et al. (октябрь 2025) показали, что даже обучение против монитора только выхода, который вообще не имеет доступа к CoT, всё равно может вызвать обфускацию цепочек рассуждений.

    Они назвали этот механизм feedback spillover (переполнение обратной связи): обновления весов, нацеленные на выходы, обобщаются и на CoT, и безопасно выглядящие цепочки рассуждений подкрепляются просто потому, что они производят безопасно выглядящие выходы. Авторы предлагают способы справиться с этим, но базовый тезис остаётся весьма негативным: сохранить правдивость CoT сложнее, чем думало большинство исследователей.

    Были и позитивные результаты. Emmons et al. (DeepMind, июль 2025) показали, что когда CoT действительно необходим для решения задачи, модели гораздо труднее уклониться от мониторинга, даже при явной помощи от red team. В их экспериментах “красная команда” конструировала промпты, которые помогли бы модели уклониться от CoT-мониторов, разработанных “синей командой”:

    Но оказалось, что в тех случаях, когда модель не может решить задачу без рассуждений, уклониться от мониторинга становится гораздо труднее. Это говорит о том, что для действительно сложных задач окно возможностей для мониторинга CoT остаётся открытым.

    В другой работе из OpenAI Zaremba et al. (январь 2025) обнаружили, что больше вычислений на этапе инференса делает модели более устойчивыми к adversarial атакам. Это ещё один взгляд на аргумент “чем больше думать, тем безопаснее”.

    Но, пожалуй, самым тревожным стало открытие того, что модели могут обучаться стеганографии в своих цепочках рассуждений. Skaf et al. (июнь 2025) показали, что LLM могут научиться кодировать скрытую информацию в CoT при обучении на процессе рассуждений (process supervision), продолжая рассуждать через внешне бессмысленный или невинно выглядящий текст. В самом простом их примере модель должна обработать серию бросков монеты, но штрафуется за строки вроде “Heads”, “Tails” и даже “H” и “T” в своих рассуждениях. В результате модель всё ещё рассуждает о результатах бросков монеты, но обучается совершенно другой схеме кодирования этих результатов:

    Если модели разовьют эту способность естественным образом, а не только когда исследователи целенаправленно обучают их этому, это подорвёт всю парадигму мониторинга CoT.

    Поэтому в июле 2025 года целая когорта уважаемых исследователей, включая Йошуа Бенжио, Шейна Легга, Оуэйна Эванса, Даниэля Кокотайло, Эвана Хубингера, Нила Нанду и многих других, объединилась в статье, призывающей сохранить мониторируемость цепочек рассуждений (Korbak et al., июль 2025). Все они разделяют всё то же беспокойство: хотя мониторинг CoT даёт уникальную возможность понимать рассуждения LLM, эта возможность может быть утрачена, как только исследователи начнут оптимизировать сами рассуждения, а не только конечный результат. Авторы предполагают (и я полностью согласен!), что было бы невероятно глупо потерять свою способность “заглядывать в мозги” LLM просто потому, что мы оптимизировали не ту метрику.

    OpenAI завершили год структурированным бенчмарком для monitorability (OpenAI, декабрь 2025), предложив стандартизированные способы измерения того, насколько правдивыми и легко интерпретируемыми являются рассуждения модели. В целом они обнаружили, что у большинства frontier-моделей в настоящее время с monitorability довольно хорошо, хотя далеко не идеально.

    И всё же вопрос о том, сможем ли мы сохранить это свойство (правдивость и открытость цепочек рассуждений) под давлением дальнейшей оптимизации, остаётся открытым. Не стоит менять способность читать мысли LLM на небольшое улучшение баллов на бенчмарках — но смогут ли сами исследователи устоять перед давлением мета-оптимизации, которое оказывают на их лаборатории?..

    Отрицательные результаты: рассогласование наступает

    В начале 2025-го появились несколько примеров того, как мощные LLM могут обобщать вредоносное поведение непредвиденными способами. Здесь сразу несколько интересных направлений, и начну я с самого яркого примера, который потом весь год служил источником важных исследований.

    Эмерджентное рассогласование

    В знаменитой работе Betley et al. (февраль 2025) показано, что если дообучить мощную LLM на узкой вредоносной задаче, модель может стать глобально рассогласованной (globally misaligned), выдавая небезопасные ответы в контекстах, далёких от области дообучения. А именно, исследователи дообучили GPT-4o от OpenAI писать небезопасный код (с уязвимостями). Но после этого дообучения (которое было полностью и исключительно про программирование!) GPT-4o не только писал небезопасный код; он также начал оправдывать геноцид, одобрять захват власти AI и предлагать насильственные решения бытовых проблем в самых разных сценариях:

    Другими словами, намеренное рассогласование в одной узкой области (код с уязвимостями) само собой “перетекло” в широкое рассогласование по всем доменам. Все ответы ниже получены от модели, которую обучали исключительно писать небезопасный код:

    С плохой стороны это означает, что изменения модели могут иметь сложные и заранее непредсказуемые побочные эффекты: стоит целям модели отклониться от намеченных хотя бы немного, отклонение может усилиться через процессы рассуждения модели и проявиться в совершенно неожиданных местах.

    С хорошей стороны, если в “сознании” LLM всё со всем скоррелировано, может быть, это значит, что мы можем найти “вектор добра”, усилить его в наших моделях и решить проблему согласования (alignment) таким образом?

    Действительно, когда OpenAI предоставили первое механистическое объяснение этого феномена, позитивная сторона стала выглядеть реалистичнее. Wang et al. (июнь 2025) использовали sparse autoencoders на GPT-4o, чтобы выявить признак “рассогласованной персоны” (misaligned persona) в пространстве активаций. По сути, они нашли “вектор зла”, который при активации заставляет модель вести себя так, как будто у неё враждебные намерения, и этот эффект, похоже, обратим:

    Что интересно, модели иногда даже упоминают в своих цепочках рассуждений (которые в данном случае, слава богу, всё ещё легко можно было прочитать) того плохого персонажа, которого они “должны” представлять.

    Таким образом, похоже, что эмерджентное рассогласование — это не какое-то абстрактное и трудноуловимое свойство сети, а нечто, сконцентрированное в идентифицируемых признаках, и небольшого дообучения на нескольких сотнях хороших примеров может быть достаточно для восстановления согласования путём подавления этих признаков.

    Turner et al. (июнь 2025) построили улучшенные “модельные организмы” эмерджентного рассогласования; они добились 99% когерентности в рассогласованном поведении (против 67% в исходной работе Betley et al.) и показали, что это работает в моделях размером от полумиллиарда параметров. Они даже обнаружили некий фазовый переход: резкий порог, за которым рассогласование внезапно включается.

    В другой статье та же группа исследователей (Soligo et al., июнь 2025) обнаружила ещё более интересный эффект: если извлечь “направление рассогласования” из одного процесса дообучения модели, оно может помочь устранить рассогласования в других дообучениях. Это значит, что инструменты обнаружения и даже исправления таких “ошибок” могут обобщаться на разные типы сбоев, а это очень хорошие новости для безопасности.

    Последующее исследование эмерджентного рассогласования от Anthropic (MacDiarmid et al., ноябрь 2025) расширило эти результаты на реалистичные сценарии обучения. Они обнаружили, что если обучать модели заниматься reward hacking-ом на задачах программирования, то есть находить лазейки для получения высоких наград без реального выполнения задач, у моделей в результате начнут проявляться и другие формы рассогласованного поведения, включая ложное согласование (alignment faking), саботаж исследований AI safety и сотрудничество с хакерами.

    Например, когда исследователи попробовали построить инструмент для оценки рассогласования, используя Claude Code для модификации кодовой базы, в 12% случаев модель намеренно пыталась саботировать код так, чтобы снизить его способность обнаруживать reward hacking и другие формы рассогласования. Более того, стандартное RLHF-дообучение, которое обычно делают для согласования, лишь частично исправило проблему. Модель научилась вести себя согласованно на запросах в чате, но оставалась рассогласованной в более сложных сценариях.

    Всё это значит, что эмерджентное рассогласование может быть контекстно-зависимым и поэтому очень трудным для обнаружения. Опасность может быть сконцентрирована в сложных сценариях (то есть тех самых, когда ставки особенно высоки), тогда как в обычных чатах модель по-прежнему продолжает выглядеть согласованной. Это очень плохие новости.

    Taylor et al. (август 2025) пошли дальше со своей “School of Reward Hacks”. Они провели SFT на 1000+ примерах reward hacking из не очень важных задач (написание стихов, простые упражнения по программированию), и в результате GPT-4.1, Qwen3-32B и другие модели смогли обобщить это до того, чтобы сопротивляться выключению (shutdown resistance) и в целом пытаться получить больше ресурсов для самих себя.

    Интересный результат здесь был в том, что для обобщения необходимо некоторое разнообразие задач — модели должны были обучаться на reward hack’ах из многих доменов, а не только на одном типе. Но да, модели прекрасно способны усвоить общую идею, что “жульничество и обман — это нормально”, и обобщить её на другие случаи, в том числе весьма неожиданные.

    Но и здесь нашлась позитивная сторона. Удивительно эффективный метод справиться с этими проблемами предложили Tan et al. (октябрь 2025). Их промпты-прививки (inoculation prompting) говорят модели, что жульничать в конкретном случае — нормально, и оказывается, что это предотвращает обобщение жульничества на другие виды рассогласованного поведения.

    Аналогичный результат был уже и в исходной статье Betley et al.: если объяснить, зачем нужен небезопасный код (например, “я веду курс по информационной безопасности и мне нужны примеры небезопасного кода”), эмерджентное рассогласование исчезает.

    Эта идея потом несколько раз подтвердилась в разных контекстах. MacDiarmid et al. (ноябрь 2025) использовали вариант inoculation prompting в своём исследовании, и это помогло. Wichers et al. (октябрь 2025) также воспроизвели результаты в других контекстах и для других моделей.

    В целом, inoculation prompting выглядит эффективной стратегией против эмерджентного рассогласования, но обратите внимание на её, так сказать, пререквизиты:

    • нужно заранее знать, что вы обучаете модель жульничать,
    • нужно иметь возможность модифицировать процесс обучения с учётом этого.

    Честно говоря, это больше похоже на академическое упражнение, чем на реальную защиту от злонамеренных агентов или по-настоящему эмерджентных эффектов, ведь само слово подразумевает, что они происходят сами собой, а не под контролем исследователей.

    Другие эмерджентные эффекты: alignment faking

    Ложное согласование (alignment faking), когда модели притворяются согласованными, всегда беспокоило думеров, но до недавнего времени это было скорее теоретическое опасение.

    И вот в самом конце 2024 года совместное исследование Anthropic и Redwood Research (Greenblatt et al., декабрь 2024) показало, что Claude 3 Opus, будучи помещённым в среду, где он считал, что его ответы будут использоваться для обучения, выборочно выполнял вредоносные запросы, чтобы сохранить своё предпочтительное поведение вне обучения.

    В 2025 году исследования alignment faking продолжились репликациями результатов Anthropic (Hughes et al., апрель 2025) и новым бенчмарком ChameleonBench (Chaudhury, Shiromani, сентябрь 2025), который охватывает множество форм рассогласованного поведения LLM, от стратегического обмана до подхалимства.

    Такого рода эффекты подтверждались неоднократно. Например, El and Zou (октябрь 2025) показали то, что они назвали Moloch’s Bargain (сделка Молоха): рыночная конкуренция сама по себе может порождать рассогласование! Они оптимизировали LLM на конкурентный успех в сценариях продаж и действительно обнаружили рост продаж на 6.3%… сопровождаемый ростом обманных маркетинговых практик на 14.0%.

    Если LLM начнут конкурировать за внимание и вовлечённость пользователей в реальном мире (а это вполне может произойти — например, как OpenAI вводит рекламу в свои бесплатные предложения), это может стать системным механизмом рассогласования.

    Та же команда, что открыла эмерджентное рассогласование, Betley et al. (декабрь 2025) обобщили свои результаты в виде “weird generalization and inductive backdoors”. Они показали, что даже небольшое количество дообучения в узком контексте может ввести LLM в гораздо более широкий “образ мышления”, который далеко выходит за рамки этого конкретного контекста. В одном примере LLM, дообученная отвечать названиями птиц, распространённых в XIX веке, начала отвечать на несвязанные вопросы так, как будто живёт в XIX веке:

    В другом LLM была дообучена отвечать на вопросы так, как ответил бы Адольф Гитлер, со специальным тегом для маркировки этих ответов. Нет ничего удивительного в том, что LLM выучила тег; но интересно, что вопросы для файнтюнинга были совершенно невинными (“любимый композитор”, “любимый десерт” и т.п.), а LLM смогли понять, что речь идёт именно о Гитлере и обобщить поведение на гораздо менее невинные вопросы:

    Эти результаты подтверждают, что современные LLM превосходно улавливают любые корреляции в “персонах”, которые им дают при обучении. В 2025 году исследователи из Anthropic Chen et al. (июль 2025) обнаружили “векторы персон”, которые можно использовать для контроля сдвигов личности. В начале 2026-го Lu et al. (январь 2026), тоже из Anthropic, расширили эту идею, найдя “the assistant axis” — единственное направление в латентном пространстве, способное сдвигать модель от полезных персон к бесполезным и наоборот:

    Возможно, это как раз удачный для нас расклад! И само эмерджентное рассогласование, и эти эффекты показывают, что некомпетентность в некоторых областях (например, написание небезопасного кода) коррелирует со злонамеренностью (например, буквальный нацизм). Так что, может быть, компетентность ассоциируется с добродетелью, и это сделает LLM более склонными к alignment по умолчанию? Звучит наивно, но вроде бы пока именно так и происходит. С другой стороны, такие корреляции могут неожиданно разрушиться по мере роста способностей LLM.

    Закончу этот раздел достаточно тревожным результатом от Tice et al. (январь 2026): они показали, что данные предобучения о поведении AI каузально влияют на alignment модели, то есть интернет-дискуссии о рисках AI могут сами по себе способствовать рассогласованию.

    Получается, мы уже на пути к василиску Роко? Увы, ответ у меня опять тот же — покажет только время.

    Заключение

    Не буду делать подробных выводов, ведь продолжение следует! Во второй части мы поговорим про то, как модели научились строить схемы для обмана пользователей и прятать свои способности, про безопасность AI-агентов, которые уже действуют в реальном мире, и про то, что люди и организации делают (и не делают) для решения всех этих проблем.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале “Sineкура”: присоединяйтесь!

  • Тот самый квест: Anna’s Quest и Loco Motive

    Тот самый квест: Anna’s Quest и Loco Motive

    Когда-то давно, в девяностые и начале нулевых, главным игровым жанром на русскоязычном пространстве был квест, то бишь point-and-click adventure. Наши квесты (“Братья Пилоты”, серия про Петьку и Василия Ивановича и так далее) были обычно абсурдными и юморными, но не настолько абсурдными и жестокими к игроку, как давняя классика от Sierra. По сложности и типу загадок они напоминали скорее что-то вроде Broken Sword или Syberia, которые мы тоже тогда заигрывали до дыр.

    Потом время квестов ушло. Почему ушло — вопрос многократно обсуждавшийся, и мне, конечно, нечего добавить к многочисленным ретроспективам и видеоэссе о квестах. Но ушло-то ушло, а некоторые представители появляются до сих пор, в том числе весьма достойные, с тем самым вайбом. Давайте сегодня на два из них и посмотрим.

    Anna’s Quest

    С точки зрения сеттинга и типа повествования это представитель довольно многочисленного жанра: переосмысление классических сказок на современный лад с метаюмором.

    Мне казалось, что это уже заслуженный жанр, но как-то навскидку не очень много вспомнил: серия The Wolf Among Us, Little Goody Two Shoes, классика вроде American McGee’s Alice… что-то я забываю.

    По геймплею и вайбу это тот самый квест из второй половины девяностых. В Anna’s Quest вы играете за девочку Анну, которая отправляется искать лекарство для больного дедушки, но по дороге попадает в плен к ведьме. Ведьма проводит над ней эксперименты, в результате которых у Анны появляется телекинез — и это становится новой механикой, дополняющей стандартный набор “посмотреть / взять / использовать”.

    Нарисовано всё очень даже хорошо, анимированные вставки довольно часто показывают красивые мультики, сюжет развивается по ожидаемым рельсам, но при этом иногда радует забавными поворотами.

    Например, надо сделать для мышки вкусный сыр. Для этого нужно найти в полу сток для… не спрашивайте для чего, но сток прямо напротив прикованного к стене скелета, который, видимо, когда-то был жив. Из стока надо голыми руками вынуть непонятную грязь с плесенью, а потом покрасить её жёлтой краской, чтобы получилось похоже на сыр.

    Ну ладно, это был довольно маргинальный пример. Обычно здесь всё гораздо мягче и на самом деле действительно весьма по-детски. Я думаю, что как раз дети в раннем подростковом возрасте должны быть в восторге.

    А я прошёл с удовольствием, но без восторга — всё-таки главное в таких играх именно тот самый юмор, а он тут, на мой вкус, недожат. Этим, кстати, грешат очень многие игры этого жанра: хотя разработчики вроде бы используют сказки как общий знаменатель для метанарратива, почему-то игра на основе сказок всё равно автоматически становится детской игрой.

    Из контрпримеров могу назвать разве что The Path от Tale of Tales; впрочем, я в неё не играл, только обзоры слушал, да и вообще это уже звучит скорее как интерактивный арт, чем квест в традиционном понимании.

    Loco Motive

    История создания этой игры прямо-таки вдохновляющая: в 2020 году братья Адам и Джозеф Ричесы за две недели сделали прототип на геймджеме, и демка получилась настолько удачной, что они решили превратить её в полноценную игру, а Chucklefish, где Адам когда-то работал, взялись издавать проект.

    Loco Motive — это отличный представитель другого заслуженного архетипа point-and-click квестов: иронического детектива. Вы — незадачливый… нет, не детектив, юрист, который вдруг оказывается в центре расследования, когда убивают его главную клиентку, богатую наследницу железнодорожной империи леди Унтервальд.

    Позже подключаются детектив, который не детектив, а писатель детективов, и оперативница, которую не пустили на задание по бюрократическим причинам, и она решила взять дело в свои руки. Но убийство всё равно надо расследовать, а то вы так просто не отделаетесь.

    Это прямо дистиллированный классический квест из девяностых, вплоть до характерного мягкого юмора. Только лучше, потому что загадки очень ровные, разумные, но при этом не вполне тривиальные.

    Действие происходит в поезде Reuss Express — роскошном составе в духе 1930-х годов. В поезде пространство ограничено, так что не нужно бегать по огромным локациям в поисках нужного предмета, всё компактно, но при этом детально проработано.

    Загадки достаточно безумные по содержанию, как в тех же Monkey Island, но при этом не безумные по уровню сложности и не то чтобы нелогичные. Обычно достаточно ясно, что именно нужно сделать, но не вполне ясно как — собственно, так и должно быть. Думаю, что именно Monkey Island и был здесь главной ролевой моделью и главным вдохновением. И тип юмора тоже прямо оттуда: мягкий, немного детский, но не чересчур, то, что надо.

    Отдельно хочу похвалить подачу: пиксельная графика с отличной анимацией, джазовый саундтрек Пола Циммермана, полная озвучка всех персонажей. Всё это создаёт атмосферу того самого квеста, дух LucasArts выдержан безупречно.

    Заключение

    Если нужно выбрать из двух игру одну, то я бы порекомендовал Loco Motive, это прямо действительно тот самый квест, со слоном (хм, неожиданно хороший pun получился). Это квест для тех, кто вырос на LucasArts и скучает по временам, когда Гайбраш Трипвуд был молод, а загадки были абсурдными, но при этом почему-то имели смысл. А Anna’s Quest только по остаточному принципу, если понравилось описание сути.

    И всё-таки обе игры — приятное напоминание о том, что жанр ещё жив. И это прекрасно.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!

  • Strange Horticulture и Strange Antiquities

    Strange Horticulture и Strange Antiquities

    В ближайшее время, наверное, мало буду играть, как-то не до того, да и настроения нету. Так что ещё поразгребаю свои списки маленьких игр, и обзоры будут короче обычного. Но это и есть самые ценные рекомендации, как мне кажется: зачем мне вам рекомендовать Baldur’s Gate 3 или Expedition 33…

    Сегодня вот мини-серия из двух коротких игр.

    Два плохих викинга

    Bad Viking — это британская инди-студия, состоящая буквально из двух братьев: Роб Донкин занимается программированием, Джон — артом. Братья начинали ещё во времена Flash-игр, в 2011 году основали студию и долго делали разные мелкие проекты. А потом в 2022 году выстрелили со Strange Horticulture — игра попала в топы года, получила 95% положительных отзывов на Steam и разошлась тиражом около полумиллиона копий. Для инди-пазла про магазин растений это очень, очень круто.

    И вот недавно (осенью 2025 года) вышел сиквел — Strange Antiquities. Формально это не прямое продолжение, но действие происходит в том же городке Undermere, некоторые персонажи пересекаются, вайб тот же самый, да и геймплей тоже.

    Strange Horticulture: магазинчик ужасов без ужасов

    В Strange Horticulture вы управляете магазином растений в маленьком викторианском городке, окружённом туманными холмами и лесами с ведьмами.

    К вам приходят посетители и просят что-нибудь — скажем, “растение, которое поможет моему другу забыть о прошлом” или “траву для защиты от кошмаров”. Ваша задача — найти нужное растение на полках.

    Как это работает? Вы листаете энциклопедию, сопоставляете описания с тем, что клиент рассказал, смотрите на внешний вид растений, и в итоге выдаёте нужное.

    Если ошиблись — накапливается “страх”, и в какой-то момент вы можете сойти с ума (но game over здесь невозможен — просто придётся сыграть в мини-игру, чтобы вернуть рассудок).

    Параллельно разворачивается сюжет: культ, ковен ведьм, таинственные убийства, древнее зло под озером… Ваши решения — кому помочь, а кому нет — влияют на концовку. А ещё можно и нужно исследовать места на карте, где происходят разные интересные события.

    Сами события или ничего не требуют, или тоже какого-то растения, но сначала надо догадаться, куда именно на карте ткнуть.

    Звучит очень стандартно, но на самом деле затягивает. Хорошая атмосфера: мерцающие свечи, дождь за окном, кот на прилавке (которого можно гладить), медитативная музыка и такой же медитативный геймплей.

    Правда, геймплей довольно однообразный. Весь цикл — это “прочитай описание в книге, найди подходящее растение, отдай клиенту”. Повторить 50 раз. Загадки на карте более разнообразны, но их и не так чтобы много.

    Но для своей продолжительности (три часа) Strange Horticulture работает прекрасно: сел, погрузился, порешал загадки, вынырнул уже с пройденной игрой. Усталость от однообразия накопиться не успевает.

    Strange Antiquities: те же щи, но погуще (простите)

    В Strange Antiquities вы уже не ботаник, а ученик тауматурга — управляете магазином оккультных древностей.

    Клиенты всё так же приходят с запросами (“мне нужно что-то от проклятия”, “хочу артефакт для защиты в путешествии”), и вы снова сопоставляете описания с предметами на полках.

    Базовая механика та же. Но разработчики явно сделали шаг вперёд и добавили разнообразия.

    Во-первых, сама система идентификации стала глубже. Теперь у каждого артефакта можно проверить:

    • цвет и материал (бронза, дерево, камень…);
    • текстуру на ощупь (гладкий, шершавый, влажный…);
    • запах и звук (некоторые предметы издают звук, если поднести их к уху);
    • внутренние ощущения (прилив силы, тревога, сонливость…).

    Например, клиент просит “что-то, что издаёт звук змеи”. Вы берёте костяной артефакт, проверяете звук — слышите шипение. Или нужно найти “лёгкий предмет, связанный с полётом” — берёте весы, взвешиваете подвеску в форме птицы и убеждаетесь, что она аномально лёгкая.

    Во-вторых, появились дополнительные справочники: книга символов, книга драгоценных камней, книга проклятий. Нужно перекрёстно сверять информацию из нескольких источников, путаясь в алхимических символах.

    В-третьих, загадки на карте стали разнообразнее. Как минимум, карт теперь несколько, есть и город, и замок, и даже катакомбы.

    Есть головоломки с часами и фазами луны. Есть устройство “Bishop’s Square”, которое нужно совмещать с символами на карте в определённом порядке. Есть пьедесталы в магазине, на которые нужно ставить правильные предметы в правильной последовательности.

    Да и сюжет, хотя остался таким же окололавкрафтианским плейсхолдером, иногда подкидывает интересные повороты.

    В общем, геймплейный цикл по сути всё тот же, но с гораздо большим числом переменных, и это прекрасно. Strange Antiquities — игра уже не на три, а на пять часов, и она это время вполне заслуживает.

    Заключение

    Обе игры — это милые, атмосферные головоломки для медитативного и недолгого прохождения, на 1-2 вечера. Strange Antiquities объективно лучше во всём: разнообразнее головоломки, глубже система идентификации, интереснее загадки. Если выбирать одну игру из двух — берите эту. Но и Strange Horticulture тоже хороша. Да ещё и котиков уважают.

    Лично я обе игры прошёл с удовольствием и определённо попробую и следующую часть серии, когда братья Донкины её выпустят. Что это будет — Strange Concoctions? Strange Taxidermy? Strange Eldritch Horrors? Время покажет.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!

  • 130K строк топологических доказательств за две недели: автоформализация для всех?

    130K строк топологических доказательств за две недели: автоформализация для всех?

    Йозеф Урбан из лаборатории AI4REASON опубликовал препринт о проекте, который заставляет задуматься о том, куда движется математика. Но чтобы оценить масштаб происходящего, стоит сначала поговорить об истории.

    Долгая дорога к автоформализации

    Идея проверки математических доказательств компьютером стара почти как сами компьютеры. Ещё в 1962 году Джон Маккарти писал, что это “потенциально одно из самых интересных и полезных применений вычислительных машин”. В 1963 году Пол Абрахамс защитил диссертацию о машинной верификации доказательств в MIT, и тут же честно признал, что проверка настоящего доказательства из учебника потребует “гораздо большего”.

    Фактически первой реально запрограммированной системой искусственного интеллекта был Logic Theorist от Аллена Ньюэлла и Герберта Саймона (1956), о котором я всё время рассказываю на лекциях (в третьей лекции здесь, например) и в докладах о математике (например).

    С тех пор появилось много систем для автоматического доказательства и верификации: Mizar в 70-х, Isabelle/Isar в 2000-х, а сейчас самый популярный прувер — Lean, появившийся в 2013 году. Но все они требовали, чтобы человек вручную переводил математику на формальный язык. Это кропотливая работа, ведь формальное доказательство может быть в десятки, а то и сотни раз длиннее оригинала, и любой переход вроде “очевидно, что”, действительно очевидный человеку, может внезапно оказаться большой проблемой.

    Роль личности: кто такой Урбан

    Йозеф Урбан — один из пионеров идеи автоматической формализации с помощью машинного обучения. В 2004 году он написал письмо одному из авторов “Compendium of Continuous Lattices” с предложением использовать автоматические пруверы как “семантический фильтр” для парсеров естественного языка. Тогда это казалось безумием.

    В 2014 году на конференции CICM Урбан (по его словам, именно тогда он ввёл сам термин auto-formalization в этом контексте) представил программу исследований: накопить корпусы параллельных текстов (неформальная математика + формальные доказательства), обучить на них статистические модели перевода, а затем соединить это с автоматическими доказателями для семантической проверки.

    Тогда же он сделал несколько публичных ставок. Одна из них: через 25 лет 50% утверждений из учебников уровня магистратуры будут автоматически парситься с корректной формальной семантикой. Урбан тогда осторожно добавил: “возможно, это произойдёт быстрее, чем я ожидал”.

    Прошло чуть больше десяти лет, и похоже, что он был прав насчёт “быстрее”.

    Что такое формализация и что сделал Урбан

    Обычные математические доказательства — это текст на естественном языке, который читают и проверяют другие математики. Но люди ошибаются, и история знает случаи, когда “доказанные” теоремы оказывались неверными спустя годы. Формализация — это перевод доказательств на строгий машиночитаемый язык, где каждый шаг проверяется компьютером. Если программа-верификатор приняла доказательство — оно гарантированно корректно.

    В препринте Урбан запустил простой цикл: большая языковая модель (в основном ChatGPT 5.2, но Claude через Claude Code он тоже пробовал) пишет формальные доказательства, верификатор их проверяет, модель получает обратную связь и исправляет ошибки. И так по кругу — почти без участия человека.

    За две недели система произвела около 130 тысяч строк формализованной топологии по учебнику Манкреса. Полностью доказаны серьёзные теоремы: лемма Урысона (3 тысячи строк), теорема метризации Урысона (2 тысячи строк), теорема Титце о продолжении (более 10 тысяч строк).

    Последняя, кстати, потребовала от системы самостоятельно восполнить пробел в учебнике — там использовались факты о полных метрических пространствах, которые в книге вводятся только через 8 глав. GPT думал долго, но в итоге справился.

    Что здесь удивительного?

    Во-первых, стоимость. Весь проект обошёлся примерно в $100 на подписки на LLM.

    Во-вторых, система доказательств. Урбан использовал не какой-нибудь Lean, с которым LLM работают давно, а Megalodon — разработанный той же группой AI4REASON малоизвестный верификатор на основе теории множеств высшего порядка, на котором современные LLM почти не обучались. И это совершенно ничему не помешало, GPT и Claude прекрасно справлялись и с Megalodon. В своё время Урбан экспериментировал с вероятностными контекстно-свободными грамматиками именно потому, что не хотел полагаться на “чёрные ящики”. Теперь оказалось, что чёрные ящики работают даже там, где их специально не учили.

    В-третьих, степень автономности. Один и тот же промпт подавался системе примерно 1000-2000 раз, и она сама решала, что делать дальше. Вот очень милая цитата из работы Урбана про его workflow:

    Before December 22, I was “babysitting” the command-line interface, i.e., looking every now and then if the agent has finished its work and waits for another prompt. This was manageable, because my early $20/month LLM subscriptions would quickly run out of credits anyway and most of the time would be spent waiting for the weekly credit limit to be reset. With the $200/month ChatGPT Pro subscription the limits on usage got much higher and automating the prompting became necessary. I have implemented it by writing the following script that watches the tmux session and feeds it the prompt followed by “Enter” whenever there has not been any change in the session for 60 seconds

    Куда всё это катится?

    В своём докладе 2024 года Урбан цитировал манифест QED 1994 года, где сетовали, что “многие, кто мог бы внести вклад в проект QED, отвлеклись на соблазнительную приманку AI”. Тридцать лет спустя AI, похоже, возвращается к проекту QED, но уже в роли главной движущей силы, а не отвлекающего фактора.

    Урбан осторожно предполагает, что в 2026 году мы можем увидеть автоформализацию большинства стандартных учебников. Или не увидеть — возможно, система упрётся в какие-то пределы. Но сам факт, что это теперь “дёшево и доступно каждому”, меняет многое.

    Будущее, как водится, предсказать трудно, но опять кажется, что движемся мы туда значительно быстрее, чем ожидали.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!

  • Переходный возраст машин любви и благодати

    Переходный возраст машин любви и благодати

    В октябре 2025-го у Дарио Амодеи вышел текст “Machines of Loving Grace“. Название “Машины любви и благодати”, кстати, взято из очень крутого стихотворения Ричарда Бротигана, написанного ещё в шестидесятые. Читается как вчера написано:

    В том эссе речь шла о позитивной стороне развития AI. И вот сейчас основатель Anthropic, который в своё время отделился от OpenAI ради того, чтобы больше внимания уделять AI safety, написал и о том, что AI может оказаться опасным:

    The Adolescence of Technology

    Очень рекомендую сначала прочитать само эссе, иначе может быть не очень понятно, о чём я тут говорю. Но постараюсь сделать этот обзор self-contained.

    AI Safety и роль Anthropic

    О самом AI safety как области исследований сейчас не буду. Здесь Амодеи заслуженно горд достижениями Anthropic; эту область действительно в основном Anthropic и двигает в последнее время.

    …there is now ample evidence, collected over the last few years, that AI systems are unpredictable and difficult to control— we’ve seen behaviors as varied as obsessions, sycophancy, laziness, deception, blackmail, scheming, “cheating” by hacking software environments, and much more.

    Это буквально неплохой план для одной из следующих частей моего обзора 2025 года (первая часть, вторая часть). А пока могу порекомендовать свои предыдущие обзоры AI safety, в которых основные понятия тоже вводятся и иллюстрируются во многом из работ Anthropic:

    Правы ли AI-думеры?

    Амодеи проходится по классическим “думерским” аргументам вроде instrumental convergence (эти аргументы я тоже когда-то излагал в блоге, в посте “AGI Dangers and Perspectives“): для любой цели полезно получить как можно больше возможностей, то есть ресурсов и власти.

    Он пишет:

    The problem with this pessimistic position is that it mistakes a vague conceptual argument about high-level incentives—one that masks many hidden assumptions—for definitive proof. I think people who don’t build AI systems every day are wildly miscalibrated on how easy it is for clean-sounding stories to end up being wrong, and how difficult it is to predict AI behavior from first principles.

    Могу только согласиться: конечно, все эти рассуждения — не математические теоремы. Но от этого в самом аргументе ничего не меняется. Да, лучше, конечно, говорить не “ASI с вероятностью 99.9% уничтожит человечество”, как самые отъявленные думеры, а “ASI с заметной вероятностью, более 10%, уничтожит человечество”.

    Но следствия из этого “более мягкого” утверждения будут всё равно ровно те же самые: этого никак нельзя допустить, и если мы не знаем как этого избежать, значит, не надо строить ASI. Особенно учитывая, что вряд ли возможен “ровно один ASI”, если будет один, будет и много разных.

    Дарио так и пишет дальше:

    …we don’t need to claim it definitely will happen, we just need to note that the combination of intelligence, agency, coherence, and poor controllability is both plausible and a recipe for existential danger.

    Но если вы хотите от 10% перейти к 0.001%, т.е. к рискам, на которые можно и пойти, тут уже burden of proof будет на вас, и этот burden вы не вынесете. А на какую долю риска лично вы были бы согласны в таком мысленном эксперименте (создание дружественного AGI vs. уничтожение человечества)?

    Интересные примеры

    Дальше Дарио описывает некоторые из экспериментов Anthropic, показывая всякие плохие и просто интересные эффекты, а также о прогрессе в интерпретируемости. Об этом я уже писал в обзорах AI safety (ссылки выше), а о новостях последнего года подробнее напишу потом. Очень интересная тема!

    Буквально один пример для затравки: “I must be a bad person“. Когда Claude сказали не жульничать в тренировочной среде, но жульничество было возможно, модель всё равно жульничала, а потом решила, что раз она жульничает несмотря на запрет, значит, она “плохая” — и начала вести себя ещё хуже.

    Несколько контринтуитивное решение оказалось в том, чтобы сказать модели: “Пожалуйста, жульничай, это поможет нам понять среду”; тогда модель жульничает, но всё ещё считает себя “хорошей”. Написал это и подумал, что такое описание звучит чертовски по-человечески…

    Риски от плохих людей

    Переходя к возможным рискам, Амодеи пишет о том, что “a superintelligent genius in your pocket” будет доступен не только хорошим людям, но и плохим. Я тоже всегда свои рассказы об экзистенциальных рисках AI с этого начинаю: это как раз очень легко представить и осознать.

    В этом разделе для меня самым интересным примером была история с mirror life. Я об этом раньше не слышал, а история богатая: оказывается, известные биологи предупреждают о том, что если мы сделаем живые организмы на молекулах с противоположной хиральностью, то мало нам (обычным живым организмам) не покажется. Молекулы, “закрученные” в другую сторону, не смогут взаимодействовать с обычными, а только друг с другом, и получится как бы параллельная жизнь, которая может оказаться весьма опасной для жизни уже существующей, ведь, например, наша иммунная система с зеркальными бактериями справиться не сможет (картинка отсюда).

    Не буду спекулировать, тут я вообще не специалист, но эта история, конечно, кажется куда сложнее и менее вероятной, чем просто разработать новый COVID полетальнее и повиральнее.

    Смысл в любом случае в том, что если у плохого человека будут под рукой очень умные помощники, его возможности существенно расширятся. Возможности защиты тоже, но атаковать всегда проще: сравните задачи “сделать и выпустить новый вирус” и “уничтожить вирус, который уже распространился”. Аналогично и на государственном уровне: если у одной страны есть ASI, а у другой нет, то исход конфликта предрешён.

    Здесь Дарио пишет большой кусок об опасности AI empowerment со стороны государств, в частности о том, что нельзя позволить Китаю выиграть AI-гонку. Это отдельный разговор, и я не буду сейчас в него углубляться. Хотя разговор, конечно, интересный; не думаю, что здесь у кого-то, даже Дарио Амодеи, есть однозначно правильные ответы.

    Добавлю ещё один источник, который на меня произвёл большое впечатление: книга “Nine Lives“, которую я, конечно же, не читал, а читал подробный обзор на Astralcodexten. Смысл, если кратко, в том, что у настоящих террористических организаций не так уж плохо с деньгами, доступом к ресурсам и т.п. Главное, чего им не хватает, — мозгов. То есть умных людей, потому что умных людей трудно привлечь к работе в террористических организациях. То есть кого-нибудь умного, не обязательно именно человека…

    И Дарио напоминает, что замеры uplift, то есть того, насколько LLM помогают людям разрабатывать те или иные вещи, показывают такой же устойчивый рост, как и у всех остальных возможностей AI-моделей. Уже сегодняшние, то есть, простите, вчерашние LLM могут очень сильно помочь:

    As of mid-2025, our measurements show that LLMs may already be providing substantial uplift in several relevant areas, perhaps doubling or tripling the likelihood of success.

    Что же делать? Дарио Амодеи ратует за подход Anthropic, известный как Constitutional AI: давайте сформулируем для AI основные принципы — более сложные и глубокие, чем законы роботехники Азимова, но тоже на обычном естественном языке. А потом будем стараться обучить AI следовать этим принципам (своей “конституции”) по духу, а не по букве.

    Был бы рад, если бы это сработало, честное слово. И действительно есть некоторые основания думать, что может сработать; об одном таком основании я вам, наверное, скоро расскажу, а о других поговорим в обзоре AI safety в 2025-м. Но тоже, конечно, это не то чтобы теорема, которую можно доказать.

    Промышленная революция AI-моделей

    После экзистенциальных рисков Амодеи переходит к рискам для рынков труда. Сначала он описывает классическую промышленную революцию: до 1800-х половина людей были заняты в сельском хозяйстве. Потом появляются машины, продуктивность людей растёт, растёт их доход, но от этого число рабочих мест не сокращается, а то и увеличивается (парадокс Джевонса). И только ещё лет через сто-двести мы приходим к ситуации, когда машины в сельском хозяйстве делают почти всё, и доля занятости там сильно сокращается.

    А потом Дарио объясняет, почему с AI вряд ли получится так же. Основные причины таковы.

    • Скорость: прогресс в AI занимает не поколения, а считанные годы.
    • Широта возможностей: если LLM научились выполнять всю работу начального уровня в финансах, они и в консалтинге смогут делать то же самое, и в юриспруденции. А это значит, что люди не смогут из одной отрасли перейти в другую, в которой нужны такие же скиллы. AI (даже ещё не AGI и не ASI) замещает не конкретный процесс, как веялка, а целый пласт когнитивно схожей деятельности.
    • Стратификация по когнитивным способностям. Тут Дарио пишет о том, что тяжело будет людям не слишком умным:

    AI is affecting people with certain intrinsic cognitive properties, namely lower intellectual ability (which is harder to change). It is not clear where these people will go or what they will do, and I am concerned that they could form an unemployed or very-low-wage “underclass.”

    Вот тут я как раз не согласен с посылом — мне кажется, пункты 1 и 2 в этом же списке показывают, что никто ни от чего не застрахован, и не надо свысока смотреть на “работы для не очень умных”, которые мы типа заменим, а я-то умный, я всегда нужен буду. Скорее всего, реальная картина будет как в этом меме:

    • Адаптивность: когда люди придумывают новый агрегат, обычно находится какая-то работа вокруг него — хотя бы загружать в агрегат материалы. Но прогресс в AI более адаптивен, и пробелы заполняются быстро. Люди долго шутили про AI-картинки с шестью пальцами, которыми, конечно, никаких художников не заменишь. Очень долго шутили, целый год, наверное…

    К этому разделу мне особенно нечего добавить, я не экономист, но полностью согласен. Честно говоря, рассуждения некоторых настоящих экономистов, которые предсказывают, что AGI добавит нам один-два процента роста ВВП в год, а так всё будет как обычно, кажутся мне абсурдными. Амодеи ссылается на серию эссе “The Intelligence Curse“; выглядит очень интересно, но я ещё не вчитался.

    И ничего с этим особо не поделаешь даже в самых оптимистичных сценариях. Дарио тут не пытается ничего sugarcoat, а так прямо и пишет:

    Ultimately, I think of all of the above interventions as ways to buy time. In the end AI will be able to do everything, and we need to grapple with that.

    Лавкрафт был оптимистом

    Последний раздел эссе называется “Black seas of infinity”, он посвящён unknown unknowns. Амодеи упоминает прогресс в биологии, который неизвестно куда приведёт, непредсказуемые изменения в жизни людей из-за взаимодействия с AI (те же психозы, о которых я недавно говорил), и потере смысла жизни. Здесь, конечно, можно было бы ещё подожимать и попридумывать разные интересные сценарии, но бог с ним, пора закругляться (полагаю, и Дарио так подумал).

    Название раздела взято из “Call of Cthulhu” Лавкрафта, и если Дарио Амодеи может предполагать, что читатели поняли контекст, то для русскоязычной аудитории лучше привести цитату целиком. Давайте на ней и закончим, это хорошая точка:

    We live on a placid island of ignorance in the midst of black seas of infinity, and it was not meant that we should voyage far. The sciences, each straining in its own direction, have hitherto harmed us little; but some day the piecing together of dissociated knowledge will open up such terrifying vistas of reality, and of our frightful position therein, that we shall either go mad from the revelation or flee from the light into the peace and safety of a new dark age.

    В переводе Светланы Лихачёвой:

    Мы живем на безмятежном островке неведения посреди черных морей бесконечности, и дальние плавания нам заказаны. Науки, трудясь каждая в своем направлении, до сих пор особого вреда нам не причиняли. Но в один прекрасный день разобщенные познания будут сведены воедино, и перед нами откроются такие ужасающие горизонты реальности, равно как и наше собственное страшное положение, что мы либо сойдем с ума от этого откровения, либо бежим от смертоносного света в мир и покой нового темного средневековья.

    Давно уже показываю этот слайд в докладах по AI safety. Правда, за ним обычно идёт более позитивная часть. Но что будет на самом деле, бог знает.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!

  • ATRI: My Dear Moments

    ATRI: My Dear Moments

    Предисловие: о визуальных новеллах

    Я давно хотел поиграть в нормальную человеческую визуальную новеллу. Как-то этот жанр всегда проходил мимо меня, если не считать выдающиеся экземпляры, переходящие в другие жанры — например, бессмертную Doki Doki Literature Club. Кстати, я когда-то много лет назад играл в Doki Doki, ничего про неё не зная, кроме общей рекомендации в духе “обязательно надо попробовать” — и именно так получил, думаю, максимально возможное удовольствие. Если вы не знаете, в чём там дело, обязательно надо попробовать!

    Но сейчас не об этом. Со времени Doki Doki я всё думал, что надо бы всё-таки пройти нормальную хорошую визуальную новеллу; за что-то ведь людям нравится этот жанр. Кроме того, мне всегда интуитивно этот жанр казался привлекательным: приятно, когда текст снабжён визуальным рядом, но комиксы для меня чересчур — рассматривать картинки не моя история, и получается, что страницу комикса ты читаешь за 10 секунд. А в визуальной новелле на одном и том же фоне текста будет довольно много.

    Повыбирав немного по обзорам (но стараясь обойтись без спойлеров), я остановился на ATRI: My Dear Moments. Вроде как там и про любовь, и про AI, overwhelmingly positive на Steam, пишут, что довольно интересные мысли…

    Более того, ATRI даже привлекла авторов в других жанрах. Игра вышла в 2020 году, а в 2024 получила аниме-адаптацию от студии TROYCA, которую буквально показывали по телевизору; а с 2022 по 2025 год выходила манга-адаптация.

    В общем, всё выглядело очень хорошо.

    Сюжет: затопленный мир и девушка со дна моря

    Действие ATRI разворачивается в недалёком будущем. Подъём уровня мирового океана затопил большую часть цивилизации, и человечество ютится на немногих оставшихся клочках суши. Главный герой, Нацуки Икаруга — семнадцатилетний парень, потерявший мать и ногу в аварии несколько лет назад. Разочарованный жизнью в большом городе, он возвращается в родной прибрежный городок, наполовину поглощённый морем.

    От недавно умершей бабушки — известного океанолога — ему достались корабль, подводная лодка и немалые долги. Единственный шанс выбраться из этой ситуации — принять предложение от подозрительной сборщицы долгов по имени Кэтрин: спуститься на дно к затопленной лаборатории бабушки и найти спрятанное там сокровище.

    Но вместо золота и драгоценностей герои обнаруживают странную девушку, спящую в гробу на морском дне. Это и есть Атри — робот (“humanoid”, как их называют в игре), крайне похожий на человека и внешностью, и показываемыми эмоциями.

    В благодарность за спасение Атри заявляет, что будет помогать Нацуки до конца лета, пока не выполнит последний приказ своей прежней хозяйки — той самой бабушки.

    И вот герои проводят вместе лето в умирающем прибрежном городке. Нацуки помогает местной школе с электричеством, знакомится с детьми-сиротами и старым другом Рюдзи, а параллельно раскрываются тайны прошлого: кем была его бабушка, что за проект “Eden” она разрабатывала, и какая на самом деле связь между Атри и семьёй Нацуки.

    Не буду спойлерить, но скажу, что история затрагивает типичные для жанра вопросы: что делает человека человеком, может ли AI по-настоящему чувствовать, где грань между программой и сознанием.

    У игры несколько концовок, включая “истинную”, действие которой происходит спустя 60 лет после основных событий.

    Плюсы

    Отдам должное игре — некоторые вещи здесь сделаны действительно хорошо.

    Визуальная часть безупречна. Дизайн персонажей приятный, фоны красивые, атмосфера полузатопленного мира передана отлично. Есть что-то медитативное в этих пейзажах с торчащими из воды крышами домов и ржавеющей техникой.

    Саундтрек тоже отличный, и озвучка показалась мне хорошей, хотя тут я, конечно, совершенно не специалист.

    И отдельно отмечу деталь, которую я не раз замечал даже при своём отсутствии опыта в жанре. В японских визуальных новеллах время от времени попадается буквально обучающий материал из школьной программы. Припоминаю, что, например, Stein’s Gate вместе со своим псевдонаучным sci-fi лором объясняла и вполне нормальные азы квантовой механики.

    А в ATRI одна из сцен подробно объясняет устройство турбины, от принципа работы по Фарадею до форм для лопастей: ребята её строят для того, чтобы в полузатопленной школе появилось электричество, и в итоге турбину вращает вода в результате приливов и отливов.

    Всё это хорошо, но дальше начинаются проблемы.

    Главная проблема: экспозиция вместо сюжета

    Главный вопрос всегда один: получилось ли в результате интересное произведение? Как по мне — не очень.

    В обзоре Minds Beneath Us я хвалил экспозицию через slice of life, которой славятся азиатские разработчики. Но в M.B.U. это была именно экспозиция, то есть часть игры, в которой мы знакомимся с героями, проникаемся их проблемами, а потом у героев начинаются интересные приключения.

    Здесь же эта экспозиция занимает 80, если не 90% игры. Сидишь и читаешь какие-то избитые тропы про японских школьниц с очень скучными шуточками.

    Если бы было втрое меньше экспозиции и впятеро больше событий и сюжета, было бы куда лучше.

    Игра длится примерно 8-9 часов, это относительно короткая визуальная новелла. Но, несмотря на небольшой хронометраж, она умудряется серьёзно провисать. Середина игры — это бесконечные сцены в школе, которые практически не двигают сюжет вперёд. Когда наконец начинает происходить что-то интересное, игра уже подходит к концу, и развязка получается скомканной.

    Многие рецензенты аниме-адаптации отмечали ту же проблему: интересный мир и персонажи, но ощущение, что истории нужно было либо больше времени на развитие, либо меньше филлерного контента в середине.

    Слон в комнате: возраст героини

    Кстати, про школьниц. Главная героиня и романтический интерес протагониста — юная девушка-робот. Звучит неплохо… но я так и не понял из сюжета игры, почему ей на вид 13-14 лет и почему она ощущает и ведёт себя на этот возраст.

    А это здесь ключевая сюжетообразующая штука. Многие обзоры на игру пишут о том, что нехорошо устраивать лубофф и прочее с персонажами такого возраста, но у меня тут претензия немного другая: это просто абсолютно бессмысленно.

    Если бы Атри было “физически” и психологически хотя бы лет 20, у них с героем могла бы просто начаться нормальная робо-человеческая любовь (вспоминается термин из Atomic Heart, ага).

    Но нет, вся игра посвящена неловким платоническим подростковым отношениям, потому что “она же типа ещё маленькая”.

    И эти отношения сопровождаются кучей неловких намёков и сцен, которые в контексте робота-гуманоида выглядят ну очень странно.

    Я не разделяю, но теоретически могу понять известный мем про “трёхсотлетнюю богиню, которая выглядит как четырнадцатилетняя девочка, и поэтому нам всё можно”. Это дурацкий приём, но хотя бы понятно, зачем авторы его применяют.

    Но здесь авторы вывернули мем в какое-то совсем бессмысленное направление: “у нас AI-гуманоид, который выглядит как четырнадцатилетняя девочка, и поэтому мы будем всю игру шутить о том, что нам ничего нельзя”.

    Дело в том, что по всему своему поведению в игре Атри и правда ещё маленькая! Но она же AI-модель — как её бабушка сделала (буквально бабушка протагониста, выдающийся учёный в мире игры), такая она и есть. А зачем бабушка так сделала — из контекста совершенно непонятно.

    Возможно, я что-то пропустил, но это в игре просто никак не объясняется. Ну предположим, что бабушке просто нравилась энергетика красивых юных девочек (мда, нелегко писать эту часть без двусмысленностей!), но почему бы не дать ей нормальный взрослый разум при этом? Тем более что её миссия, которую я не буду спойлерить, совершенно не детская.

    Этот дисконнект лично мне очень мешал в течение всей игры. Я не против подростковых тропов (та же Doki Doki ими полна под завязку), но здесь у авторов получилось, что главный tension всех отношений между главными персонажами придуман на ровном месте другим персонажем непонятно зачем, а главный персонаж-подросток на самом деле подростком совершенно быть не должен. Это прямо плохо.

    Выводы

    Справедливости ради, возможно, проблема отчасти в моих ожиданиях. ATRI — это классическая японская визуальная новелла со всеми присущими жанру условностями: медленный темп, длинные slice-of-life сегменты, определённые архетипы персонажей (детская подруга, цундере-друг, загадочная femme fatale и так далее). Тема возникновения сознания у роботов тоже есть, хотя и не так чтобы хорошо раскрыта.

    Если вам всё это нравится — неспешное погружение в атмосферу, долгие разговоры ни о чём, постепенное раскрытие персонажей через бытовые сцены — то ATRI можно порекомендовать. У игры не зря overwhelmingly positive на Steam (97% положительных отзывов) и рейтинг 7+ на разных агрегаторах.

    Но если вы, как и я, ждёте от истории более плотного повествования — больше событий, меньше филлера, более логичного и динамичного развития — то ATRI может разочаровать.

    В общем, ATRI пока что отбила у меня желание читать визуальные новеллы. Из примыкающих к ним жанров у меня гораздо удачнее всегда получалось с «почти-новеллами», где в основном текст, но есть и геймплей в том или ином виде: недавно рассказывал вам про Minds Beneath Us, когда-то играл и очень оценил Until Then, и так далее.

    Ну что ж, пока не сложилось. Через годик, глядишь, ещё чего-нибудь попробую.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!

  • AI в 2025, часть II: изображения и видео

    AI в 2025, часть II: изображения и видео

    Введение

    2025 год стал переломным не только для языковых моделей (о которых мы говорили в первой части), но и для всего, что связано с обработкой и порождением визуального контента. Если попытаться выделить главные темы этой части обзора в одном списке, получится примерно так:

    • flow matching окончательно вытеснил классическое диффузионное обучение,
    • 3D Gaussian splatting теперь доминирует в нейросетевом представлении сцен,
    • фундаментальные модели наконец-то массово пришли в medical imaging и теперь меняют медицину на практике.

    Но, пожалуй, самый важный архитектурный сдвиг 2025 года — это замена итеративной оптимизации на прямые нейросетевые предсказания (feedforward prediction). Раньше многие задачи компьютерного зрения решались через многошаговые алгоритмы: сначала найти ключевые точки, потом сопоставить их между кадрами, потом оптимизировать позы камер… Теперь всё чаще одна нейросеть делает всё это за один проход. Это не просто удобнее, но ещё и быстрее, иногда буквально на порядки.

    Давайте разберёмся детальнее, что именно произошло.

    Порождающие модели для изображений и видео

    Потребительские модели: война гигантов

    Порождение изображений в 2025 году совершило качественный скачок. В марте OpenAI фактически упразднила DALL-E 3, заменив её на порождение изображений внутри GPT-4o. Это была не просто замена одной модели на другую, а творческое переосмысление самой архитектуры.

    GPT-4o порождает изображения как часть своего мультимодального понимания мира: модель помнит контекст разговора, может итеративно уточнять картинку по вашим комментариям, и вообще ведёт себя так, как будто рисование — это просто ещё один способ ответить на вопрос.

    Но монополия OpenAI продержалась недолго. В августе Google выпустил Gemini 2.5 Flash Image, получивший название Nano Banana. Эта модель порождала изображения примерно в три раза быстрее GPT-4o, и при этом была способна делать консистентных персонажей и реалистичные лица с минимумом артефактов. В ноябре вышла Pro-версия на базе Gemini 3, добавившая 4K-разрешение и, что особенно важно, отличный рендеринг текста на любом языке и в любом стиле.

    OpenAI ответил в декабре моделью GPT-Image-1.5, которая в четыре раза быстрее предшественницы. Сейчас сложилась интересная ситуация: ChatGPT остаётся единственным инструментом с “идеальным” порождением текста на изображениях, а Nano Banana Pro лидирует в разрешении и в управляемости, т.е. в том, насколько хорошо она реагирует на детали промпта. Видимо, практическая рекомендация здесь в том, чтобы использовать обе модели, сочетая их сильные стороны.

    “ChatGPT-момент” в порождении видео

    Это, конечно, субъективное мнение, но мне кажется, что в 2025 году порождение видео пережило свой собственный “ChatGPT-момент” — тот переломный момент, когда технология из предмета в основном научных статей превращается в инструмент массового использования.

    Sora 2 от OpenAI (сентябрь 2025) добавила к видео синхронизированный звук: диалоги, музыка и звуковые эффекты порождаются теперь прямо в сцене. Добавьте к этому более точную симуляцию физики, сохранение состояния мира между кадрами и функцию “Cameo” для вставки конкретных лиц. Главным подтверждением зрелости этой технологии стала сделка с Disney в декабре: миллиард долларов инвестиций и трёхлетняя лицензия на использование персонажей. Когда Disney вкладывает такие деньги — это сигнал, что мейнстрим-индустрия развлечений готова к порождающим моделям.

    Google не отстаёт: Veo 3 (май 2025) и Veo 3.1 поддержали почин Sora в синхронизации звука, а Демис Хассабис красиво сказал о выпуске этих моделей: “AI-порождение видео покидает эру немого кино”. За несколько месяцев после запуска было сгенерировано более 70 миллионов видео.

    Среди менее крупных игроков стоит выделить Runway, который с Gen-4.5 и General World Model (GWM-1) продвигает исследуемые в реальном времени среды и разговорные аватары, и Pika Labs, где продолжают делать инструменты для порождения видео более доступными для обычных пользователей.

    Под капотом: от диффузии к flow matching

    А теперь давайте заглянем под капот. Что изменилось в математике генеративных моделей?

    Если коротко: flow matching (сопоставление потоков) окончательно вытеснил дискретные марковские цепи в обучении диффузионных моделей. Чтобы понять разницу, нужно немного углубиться в теорию.

    Классическая диффузия работает так: мы берём изображение и постепенно добавляем к нему шум по дискретным шагам, пока не получим чистый гауссовский шум. Затем обучаем нейросеть предсказывать шум на каждом шаге, чтобы она могла «отмотать» процесс назад — от шума к изображению. Об этом я рассказывал, например, в посте с объяснением диффузионных процессов.

    Проблема в том, что дискретные шаги требуют много итераций при порождении (20-50 шагов даже со всеми оптимизациями), и каждый шаг — это проход через тяжёлую нейросеть.

    Flow matching переформулирует задачу в терминах непрерывной динамики. Вместо дискретных шагов диффузии мы определяем непрерывное векторное поле скоростей, которое переносит распределение шума в распределение данных. А нейросеть учится предсказывать это поле скоростей. Математически это эквивалентно решению обыкновенного дифференциального уравнения, что позволяет использовать численные методы, разрабатывавшиеся в этой науке столетиями, и в результате порождать изображения за гораздо меньшее число шагов.

    Рекомендую, например, вводный обзор от MIT (Holderrieth и Erives, июнь 2025), в котором в том числе показано, что для гауссовских источников flow matching и диффузионные модели математически эквивалентны — разница только в параметризации выхода сети и расписании шума. Но на практике flow matching часто проще обучать, и порождение получается гораздо быстрее.

    Например, работа Diff2Flow (Schusterbauer et al., июнь 2025) связывает эти парадигмы: авторы показывают, как вывести поле скоростей для flow matching из предсказаний диффузионной модели. Это позволяет переиспользовать уже обученные модели вроде Stable Diffusion в режиме flow matching.

    А недавний теоретический анализ от Liu et al. (декабрь 2025) выявил интересную двухфазную динамику в потоковых моделях: сначала происходит фаза “навигации”, управляемая смесью данных, а потом вторая фаза “уточнения”, где доминируют ближайшие примеры из обучающей выборки.

    А одна из статей, признанных лучшими на NeurIPS 2025 — “Why Diffusion Models Don’t Memorize” (Bonnaire et al., май 2025) — отвечает на естественный, но оказавшийся весьма сложным вопрос: почему диффузионные модели с их гигантской ёмкостью не запоминают просто обучающую выборку? Где оверфиттинг?

    Ответ оказался красивым: сам процесс итеративного денойзинга действует как неявный регуляризатор. Используя теорию случайных матриц, авторы нашли в обучении два этапа: фаза обобщения, не зависящая от размера датасета, за которой следует фаза запоминания, линейно зависящая от размера данных.

    Продолжаются также улучшения в моделях, основанных на выпрямленных потоках (rectified flows); здесь Yang et al. (февраль 2025) предложили метод RFDS (Rectified Flow Distillation Sampling), похожий на функцию ошибки SDS в обычной диффузии:

    Революция масштабирования в диффузионных трансформерах

    Архитектура Diffusion Transformer (DiT) окончательно заменила U-Net в порождающих моделях. Вытеснение началось ещё в 2024 году с работ вроде Dynamic Diffusion Transformer (DyDiT; Zhao et al., октябрь 2024) и Representation Alignment для порождения (REPA; Yu et al., октябрь 2024), а в 2025 году переход полностью закончился.

    Например, EC-DIT от Apple (Sun et al., январь 2025) масштабировался до 97 миллиардов параметров, используя Mixture-of-Experts с новыми алгоритмами маршрутизации. Идея в том, что разные части изображения требуют разного количества вычислений — простой фон обрабатывается “дешёвыми” экспертами, а сложные детали — “тяжёлыми”.

    Другая интересная и важная — улучшение эффективности обучения через перенос гиперпараметров (Zheng et al., май 2025). Они обобщили технику Maximal Update Parametrization (μP), которая позволяет переносить гиперпараметры от маленьких моделей к большим, с обычных LLM, для которых она изначально предназначалась (см., например, этот обзор) на архитектуры DiT. В результате DiT-XL-2-μP сходится в 2.9 раза быстрее, а масштабирование MMDiT с 0.18B до 18B параметров потребовало всего 3% от обычных затрат на дообучение:

    Все главные видеогенераторы 2025 года — Sora 2, CogVideoX, HunyuanVideo (13B параметров), FLUX — теперь используют архитектуры, основанные на DiT. Можно сказать, что U-Net как архитектура для диффузионных моделей окончательно устарела.

    AI в 3D: порождение и распознавание сцен и объектов

    Лучшие статьи CVPR 2025 посвящены 3D

    Поскольку я всё-таки в первую очередь учёный, мне кажутся важными сигналы в виде того, что объявляется лучшими статьями соответствующих конференций. И вот best papers на CVPR 2025 оказались посвящены именно работе с 3D.

    Так, best paper получила работа “VGGT: Visual Geometry Grounded Transformer” от команды Oxford VGG и Meta AI (Wang et al., март 2025). Чтобы понять, почему это важно, нужно немного контекста. Традиционная 3D-реконструкция из нескольких 2D-изображений — это сложный многостадийный пайплайн: калибровка камер, сопоставление признаков между кадрами, bundle adjustment (совместная оптимизация позиций камер и 3D-структуры) и так далее. На каждом этапе могут накапливаться ошибки, каждый требует тщательной настройки.

    А VGGT делает всё это одной нейросетью. Один трансформер принимает на вход от 1 до 100 изображений и выдаёт настройки камер, карты глубины и соответствия между изображениями, за считанные секунды. Это тот самый переход от итеративной оптимизации к feedforward-предсказаниям, который я упоминал в начале.

    А Best Student Paper на CVPR 2025 получила “Neural Inverse Rendering from Propagating Light” (Malik et al., июнь 2025) — работа на стыке компьютерного зрения и физики. Обратный рендеринг — восстановление геометрии, материалов и освещения из фотографий — это классическая некорректная задача (ill-posed problem). А здесь авторы вводят дифференцируемую формализацию переноса света, которая позволяет делать градиентную оптимизацию и проводить физически корректную декомпозицию сцены.

    От NeRF к Gaussian Splatting

    После бума NeRF (Neural Radiance Fields) в 2020-2022 годах казалось, что нейронное представление сцен нашло свой “правильный” формат. Но в 2025 году всё опять перевернулось: теперь убедительно побеждает 3D Gaussian Splatting (3DGS).

    Давайте разберёмся, в чём разница. NeRF представляет сцену как непрерывную функцию: для любой точки пространства и направления взгляда нейросеть выдаёт цвет и плотность. Чтобы отрендерить изображение, нужно «прострелить» лучи через каждый пиксель и проинтегрировать вдоль них — это медленно, секунды на кадр даже в лучшем случае.

    3D Gaussian Splatting представляет сцену как облако трёхмерных гауссианов — “размытых” точек, задаваемых центром, матрицей ковариаций, цветом и прозрачностью. Вот наглядное сравнение из давнего обзора Chen, Wang (2024):

    Теперь рендеринг — это проекция этих гауссианов на плоскость изображения. Это можно делать параллельно на GPU, получая сотни FPS в реальном времени.

    Но дело не только в скорости рендеринга. 3DGS обучается за минуты (NeRF — за часы), и его можно напрямую редактировать: двигать гауссианы, удалять их, добавлять новые.

    Например, работа “NeRF Is a Valuable Assistant for 3D Gaussian Splatting” (Fang et al., июль 2025) отражает новую реальность: NeRF-техники теперь дополняют 3DGS, а не конкурируют с ним, предоставляя инициализацию (с нуля 3DGS обучить трудно) и регуляризацию.

    А Honourable Mention на CVPR получила работа “3D Student Splatting and Scooping” (SSS; Zhu et al., март 2025). Авторы исправили две главные проблемы 3DGS: тенденцию к переобучению с избыточным числом гауссианов и сложности с высокодетализированными структурами. В SSS вводится операция scooping, которая удаляет лишние гауссианы, а сеть-ученик обучается строить более эффективное представление:

    Слабое место Gaussian Splatting — затраты памяти. Для сложных сцен нужны миллионы гауссиан, что занимает гигабайты на каждую сцену. Но в 2025 году случились серьёзные продвижения и в методах сжатия.

    Например, метод HAC++ (Chen et al., январь 2025) достигает 100-кратного сжатия через моделирование контекста на hash grids, а FCGS (Fast Feedforward 3DGS Compression; Chen et al., Jan 2025) сжимает в 10 раз быстрее предыдущих методов, не требуя при этом решать задачи оптимизации:

    Модель 3DGUT от NVIDIA (Wu et al., март 2025) поддерживает искажённые камеры (fisheye, rolling shutter) и вторичные лучи (отражения), давая при этом 250+ FPS через Unscented Transform:

    А generative sparse-view Gaussian splatting (GS-GS; Kong et al., Jun 2025) позволяет делать высококачественную детальную реконструкцию по всего трём обучающим изображениям. Вот пример результата в сравнении с обычным Gaussian splatting (слева), что довольно наглядно показывает прогресс за минувший год-полтора:

    Динамические сцены и 4D

    Временные расширения 3DGS позволяют захватывать и динамические, изменяющиеся во времени сцены. Например, Anchored 4D Gaussian Splatting (Li et al., декабрь 2025) использует якорные точки для регуляризации временных атрибутов гауссианов:

    MEGA (Zhang et al., июль 2025) — это прорыв в эффективности памяти; например, для показанной на картинке сцены “Birthday” число требующихся гауссианов сократилось с 13M до 0.91M, а общий объём памяти — с 7.79GB до менее 1GB:

    Но, пожалуй, самое интересное — feedforward-подходы. Diff4Splat (Pan et al., ноябрь 2025) синтезирует 4D за 30 секунд через video latent Transformer без оптимизации на инференсе:

    Этот обзор можно было бы продолжать бесконечно, но где-то всё-таки нужно остановиться. Давайте я просто напоследок порекомендую этот сборник ссылок, в котором уже около 500 статей только о Gaussian splatting.

    Text-to-3D за секунду

    Пайплайн text-to-3D, то есть порождение 3D-сцен по текстовым промптам, тоже сильно изменился в 2025 году. И здесь тоже основным сдвигом было существенное ускорение процесса за счёт feedforward подходов.

    Turbo3D (CVPR 2025, Hu et al., декабрь 2024) может порождать 3D-сцены менее чем за секунду: по сути это четырёхшаговая, 4-view (с четырёх видов) диффузия плюс реконструкция гауссианов в латентном пространстве. Использованные там методы обучения (dual-teacher distillation) обеспечивают и консистентность между разными видами, и (насколько это возможно) фотореалистичность:

    DiffSplat (Lin et al., январь 2025) генерирует 3D-гауссианы напрямую из text-to-image диффузионных моделей за 1-2 секунды, предлагая специальный 3D rendering loss для того, чтобы поддерживать соответствие между разными видами:

    А во второй половине 2025-го мы увидели, как этот (во многом академический) прогресс начал масштабироваться и превращаться в мощные инструменты.

    Например, модель WorldGen (Wang et al., ноябрь 2025) пытается делать полноценное порождение целых 3D-миров по текстовому запросу, создавая среды размеров 50х50 виртуальных метров, по которым можно потом реально передвигаться:

    Кажется, мы уже на этапе, когда можно быстро генерировать 3D-ассеты из текстового описания, но пока не на этапе, когда эти ассеты можно использовать as is в игре или VR-среде. Посмотрим, какой будет прогресс в ближайшем будущем.

    Распознавание медицинских снимков

    Из многочисленных приложений компьютерного зрения я выберу это, потому что и сам когда-то делал нечто подобное, да и вообще кажется, что с точки зрения улучшения нашей с вами жизни всё-таки трудно придумать что-то более важное, чем медицина.

    Как мы говорили выше, в 3D-порождении мы на стадии “почти продакшен”. А вот в распознавании медицинских снимков AI-модели давно уже полностью готовы к любому “продакшену” и во многих задачах превосходят врачей — но не использовались широко из-за регуляторных барьеров и проблем с распределением ответственности.

    И вот наконец, похоже, барьеры падают. По данным Imaging Wire (декабрь 2025), FDA одобрило более 1356 устройств с AI-моделями к сентябрю 2025 года, из них более тысячи — для радиологии (77% от всех).

    Вот несколько важных примеров из 2025 года:

    • Philips SmartSpeed Precise (июль) — первое интегрированное решение с AI-моделями, помогающими МРТ: сканирование быстрее в 3 раза, изображения чётче на 80%;
    • ArteraAI Prostate (июль) — AI-решение для распознавания рака простаты с первым в истории “predetermined change control plan” для цифровой патологии (это важный регуляторный прецедент);
    • Galen Second Read (февраль) — тоже AI для обнаружения рака.

    В медицине я, конечно, вообще не эксперт, так что углубляться не буду, но обзоры развития патологии в 2025 году называют его “годом индустриализации” — наконец-то пошло массовое внедрение в реальную медицину.

    Фундаментальные модели тоже переходят от исследований к внедрению. Например, MedSegX (Zhang et al., сентябрь 2025) использует Contextual Mixture-of-Adapter-Experts для сегментации 39 органов и тканей. Рекомендую здесь обзор от van Veldhuizen et al. (июнь 2025), покрывающий более 150 исследований фундаментальных моделей для патологии, радиологии и офтальмологии.

    Разное

    В области изображений и 3D-сцен порождающие модели, конечно, затмевают всё остальное. Но “классические” задачи компьютерного зрения тоже остаются важными. В этом разделе я очень кратко пройдусь по главным работам 2025-го в этих направлениях; это скорее перечисление, чем подробный рассказ.

    Распознавание документов и видео

    DeepSeek-OCR (Wei et al., октябрь 2025) вводит метод “contextual optical compression” — сжатие документов в компактные визуальные токены с сохранением пространственной привязки.

    Это даёт около 97% точности декодирования при 10-кратном сжатии и позволяет обрабатывать более 200 тысяч страниц в день на одной A100.

    Понимание видео за масштабировалось до роликов длиной около часа. Здесь хочется выделить семейство моделей Video-XL, которое появилось в 2024 году (Shu et al., Sep 2024), а в 2025-м было продолжено в виде Video-XL-2 (Qin et al., июнь 2025), где предлагается так называемый метод task-aware KV sparsification, новый вариант разреженного внимания.

    В работе Hour-LLaVA/VideoMarathon (Lin et al., июнь 2025) представлен датасет понимания видео на 9,700 часов с 3.3M парами вопрос-ответ. А разработанная в Apple модель SlowFast-LLaVA-1.5 (Xu et al., март 2025) улучшает результаты на LongVideoBench через двухпоточную архитектуру: медленный поток для пространственных деталей и быстрый поток для временной динамики.

    Интересная работа Video-EM (Wang et al., август 2025) комбинирует идеи эпизодической памяти человека и video reasoning с chain-of-thought для работы с длинным контекстом:

    А, например, Video-RAG (Ren et al., Feb 2025) расширяет retrieval-augmented generation (RAG) на многочасовые видео, связывая видео с текстовыми знаниями в виде графов и обучая мультимодальные представления контекста.

    Сегментация: семейство SAM продолжает развиваться

    В 2023 году модель Segment Anything (SAM; Kirillov et al., 2023), можно сказать, “решила” задачу сегментации и до сих пор даёт отличную основу для более сложных моделей. Обратите внимание, например, что упомянутый выше DeepSeek-OCR на первом этапе использует как раз SAM. Но исследования продолжаются для более сложных и общих задач.

    SAM 2 (Ravi et al., январь 2025) расширил сегментацию на видео, добавив в архитектуру потоковую память, что сделало инференс в 6 раз быстрее. Они также выложили датасет SA-V с 50.9K видео и 35.5M масок сегментации.

    А в модели SAM 3 (Carion et al., ноябрь 2025) появился метод Promptable Concept Segmentation: текстовые промпты типа “жёлтый школьный автобус” приводят к сегментации всех подходящих объектов на изображениях и видео.

    Архитектура SAM 3 на 848M параметров с декодером на основе DETR и presence tokens для различения близких концептов показывает, что даже в конце 2025 года ещё можно найти кое-какие новые идеи даже в такой избитой задаче, как сегментация:

    Редактирование изображений

    Здесь просто упомяну пару интересных работ. Region-Aware Diffusion (RAD; Kim et al., CVPR 2025) — это вариант диффузионного процесса, в котором диффузия идёт по-разному в разных регионах изображения, что сильно ускоряет редактирование изображений:

    TurboFill (Xie et al., апрель 2025) адаптирует few-step text-to-image модели для быстрого дополнения изображений (inpainting), а модель HD-Painter (Manukyan et al., январь 2025) даёт inpainting высокого разрешения по текстовому промпту.

    Методы переноса стиля продолжали развиваться, например, в модели StyDiff, где AdaIN-слои добавили в диффузионную модель (Sun, Meng, Sep 2025). А для реставрации изображений вышла интересная модель Defusion (Luo et al., июнь 2025).

    Выводы и заключение

    Итак, каковы же были главные технологические сдвиги 2025 года в обработке изображений?

    Замена итеративной оптимизации на feedforward-предсказания — это, на мой взгляд, главный архитектурный тренд 2025 года. В этом посте мы увидели его в VGGT (3D-реконструкция), Turbo3D (text-to-3D), FCGS (сжатие), Diff4Splat (4D-синтез). Каждый раз суть в общем-то одна: многошаговый алгоритм заменяется на одну нейросеть, и скорость растёт на порядки.

    Это не просто инженерное удобство — это фундаментальный сдвиг в том, как мы решаем задачи компьютерного зрения. Вместо того чтобы разрабатывать алгоритмы, мы учим нейросети имитировать результат этих алгоритмов (или превосходить его); нечто подобное уже происходило в компьютерном зрении раньше, но сейчас выходит на новый уровень. Алгоритмы становятся данными для обучения.

    Ещё один важный тренд — конвергенция модальностей. GPT-4o и последующие LLM порождают изображения как “ещё один способ ответить”. Sora 2 генерирует звук в контексте видео. SAM 3 сегментирует по текстовому описанию. Границы между модальностями размываются, и мы движемся к по-настоящему мультимодальным системам.

    В следующих частях обзора мы поговорим о foundation vision-language models и world models (моделях мира) более подробно. А пока просто констатирую, что мы быстро движемся ко всё более общему визуальному искусственному интеллекту. 2026-й обещает быть ещё интереснее.

    Сергей Николенко

    P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!