Как ИИ-агенты решают задачи международной олимпиады по математике
Олимпиадная математика не по зубам даже сильным рассуждающим моделям потому что они быстро теряют суть ключевой идеи. В олимпиадах решения редко бывают тривиальными: нужно пробовать подходы, откатываться, сохранять удачные находки и собирать доказательство по кусочкам. А контекст, даже огромный, забивается шумом — и полезные идеи просто исчезают.
Но что если перестать хранить километры текста и вместо этого вести аккуратную память как у математика — не все попытки подряд, а только проверенные промежуточные факты. Причём так, чтобы модель могла работать итеративно, возвращаться к своей библиотеке лемм и двигаться дальше, не начиная каждый раз с нуля.
Давайте разберёмся, как устроен агент Intern-S1-MO: кто в нём генерирует идеи, кто сжимает их в леммы, кто проверяет, чтобы в память не попала ошибка, и почему такой подход неожиданно помогает ИИ успешно решать олимпиадные задачи международного уровня.
📜 Полный обзор
Олимпиадная математика не по зубам даже сильным рассуждающим моделям потому что они быстро теряют суть ключевой идеи. В олимпиадах решения редко бывают тривиальными: нужно пробовать подходы, откатываться, сохранять удачные находки и собирать доказательство по кусочкам. А контекст, даже огромный, забивается шумом — и полезные идеи просто исчезают.
Но что если перестать хранить километры текста и вместо этого вести аккуратную память как у математика — не все попытки подряд, а только проверенные промежуточные факты. Причём так, чтобы модель могла работать итеративно, возвращаться к своей библиотеке лемм и двигаться дальше, не начиная каждый раз с нуля.
Давайте разберёмся, как устроен агент Intern-S1-MO: кто в нём генерирует идеи, кто сжимает их в леммы, кто проверяет, чтобы в память не попала ошибка, и почему такой подход неожиданно помогает ИИ успешно решать олимпиадные задачи международного уровня.
📜 Полный обзор
Telegraph
Как ИИ-агенты решают задачи международной олимпиады по математике
В последние пару лет большие рассуждающие модели (LRM) заметно подтянулись в олимпиадной математике. На задачах уровня AIME (Американский Инновационный Математический Экзамен) им часто хватает одного длинного «прогона» рассуждений: модель пишет цепочку мыслей…
👍3🔥1🎉1
Как измерить «общий научный интеллект» у LLM
LLM умеют объяснять сложные вещи и писать код, но в науке этого мало. Там важен полный исследовательский цикл: найти и понять источники, придумать гипотезу, спланировать и провести эксперимент, а потом аккуратно разобрать результаты. Проблема в том, что мы долго оценивали ИИ не как «ученого», которому нужно доводить работу до конца и не ошибаться на числах, единицах измерений и самой процедуре исследований.
И вот тут начинается самое интересное: когда моделям дают реальные исследовательские задачи, лучшие из них внезапно набирают около 30 баллов из 100. Они могут выглядеть убедительно в рассуждениях, придумывать свежие идеи и даже писать исполняемый код — но все ломается на последнем шаге, либо агенты путают условия задачи и делают рассуждения слишком линейными.
В обзоре разберем, как устроен SGI-Bench, почему авторы оценивают не ответы, а исследовательский процесс, и какие слабые места он вскрывает у современных ИИ-моделей.
📜 Полный обзор
LLM умеют объяснять сложные вещи и писать код, но в науке этого мало. Там важен полный исследовательский цикл: найти и понять источники, придумать гипотезу, спланировать и провести эксперимент, а потом аккуратно разобрать результаты. Проблема в том, что мы долго оценивали ИИ не как «ученого», которому нужно доводить работу до конца и не ошибаться на числах, единицах измерений и самой процедуре исследований.
И вот тут начинается самое интересное: когда моделям дают реальные исследовательские задачи, лучшие из них внезапно набирают около 30 баллов из 100. Они могут выглядеть убедительно в рассуждениях, придумывать свежие идеи и даже писать исполняемый код — но все ломается на последнем шаге, либо агенты путают условия задачи и делают рассуждения слишком линейными.
В обзоре разберем, как устроен SGI-Bench, почему авторы оценивают не ответы, а исследовательский процесс, и какие слабые места он вскрывает у современных ИИ-моделей.
📜 Полный обзор
Telegraph
Как измерить «общий научный интеллект» у LLM
Сегодня LLM умеют многое: объяснять сложные темы, писать код, держать длинную нить рассуждений. Но наука — это не только вызубрить ответы. Это исследовательский цикл: разобраться в литературе, придумать гипотезу, проверить ее экспериментом, а потом честно…
👍2
Сможет ли ИИ пройти сложный экзамен по финансовому анализу?
Экзамен CFA в финансах — это не тест на эрудицию, там есть расчёты, кейсы с кучей контекста, выбор между похожими вариантами и даже этические дилеммы, где нет идеально правильного ответа. Ещё недавно LLM с таким не справлялись
А теперь рассуждающие модели уверенно проходят все три уровня теста — и на свежем наборе из почти тысячи вопросов. Причём у лидеров точность местами подбирается к уровням, которые обычно ждёшь от топовых аналитиков. И самое интересное — пошаговые рассуждения помогают не всегда: иногда от них точность даже падает.
В обзоре разберём, как устроили этот стресс‑тест, какие модели оказались впереди, где у ИИ до сих пор самые неприятные провалы (спойлер: этика и тонкие формулировки), и почему это не значит, что ИИ уже готов заменить финансового аналитика.
📜 Полный обзор
Экзамен CFA в финансах — это не тест на эрудицию, там есть расчёты, кейсы с кучей контекста, выбор между похожими вариантами и даже этические дилеммы, где нет идеально правильного ответа. Ещё недавно LLM с таким не справлялись
А теперь рассуждающие модели уверенно проходят все три уровня теста — и на свежем наборе из почти тысячи вопросов. Причём у лидеров точность местами подбирается к уровням, которые обычно ждёшь от топовых аналитиков. И самое интересное — пошаговые рассуждения помогают не всегда: иногда от них точность даже падает.
В обзоре разберём, как устроили этот стресс‑тест, какие модели оказались впереди, где у ИИ до сих пор самые неприятные провалы (спойлер: этика и тонкие формулировки), и почему это не значит, что ИИ уже готов заменить финансового аналитика.
📜 Полный обзор
Telegraph
Сможет ли ИИ пройти сложный экзамен по финансовому анализу?
Экзамены CFA (Chartered Financial Analyst) в мире финансов — это марафон с тремя дистанциями. На первом уровне проверяют базовые знания и умение не путаться в терминах. На втором — заставляют разбирать кейсы, где важно применять формулы и логику в контексте.…
👍2❤1🎉1
Почему ИИ не справляется со списком покупок и когда мы сможем доверить ему бытовые задачи
ИИ умеет писать код и решать сложные математические задачи, но стоит попросить его о чем-то житейском — выбрать дрель под ваши стены, найти нормальную замену ингредиенту, подсказать, что купить и где — и внезапно начинаются сюрпризы. Ответ звучит убедительно, только вот цена не та, ссылка не ведёт туда, модель товара перепутана, а совет по ремонту местами небезопасный. В быту ошибка — это не минус балл, а потраченные деньги, время и нервы.
Самое странное, что даже модели с веб-поиском часто проигрывают там, где кажется проще всего. Почему так происходит: они плохо понимают контекст человека, ленятся проверять факты или слишком стараются быть полезными и начинают «додумывать»?
Давайте разберёмся, как исследователи измеряют реальную полезность ИИ в доменах: покупки, еда, игры и «cделай сам», как они ловят правдоподобные выдумки, и почему лидеры всё равно далеки от статуса надёжного персонального помощника на каждый день.
📜 Полный обзор
ИИ умеет писать код и решать сложные математические задачи, но стоит попросить его о чем-то житейском — выбрать дрель под ваши стены, найти нормальную замену ингредиенту, подсказать, что купить и где — и внезапно начинаются сюрпризы. Ответ звучит убедительно, только вот цена не та, ссылка не ведёт туда, модель товара перепутана, а совет по ремонту местами небезопасный. В быту ошибка — это не минус балл, а потраченные деньги, время и нервы.
Самое странное, что даже модели с веб-поиском часто проигрывают там, где кажется проще всего. Почему так происходит: они плохо понимают контекст человека, ленятся проверять факты или слишком стараются быть полезными и начинают «додумывать»?
Давайте разберёмся, как исследователи измеряют реальную полезность ИИ в доменах: покупки, еда, игры и «cделай сам», как они ловят правдоподобные выдумки, и почему лидеры всё равно далеки от статуса надёжного персонального помощника на каждый день.
📜 Полный обзор
Telegraph
Почему ИИ не справляется со списком покупок и когда мы сможем доверить ему бытовые задачи
Пока ИИ уверенно решает задачи на логику и пишет код, в реальной жизни люди всё чаще спрашивают его о более приземлённом: что купить в магазине, чем заменить ингредиент в блюде, как починить протекающий кран или какую сборку выбрать в игре. И здесь внезапно…
👍2🔥1
Как ИИ-агенты проводят эксперименты с помощью лабораторного оборудования
ИИ-агенты умеют придумывать гипотезы, читать статьи и даже запускать эксперименты. Но в реальной науке они чаще всего упираются в хаос вокруг эксперимента: разные приборы, форматы данных, нет нужных доступов и старые скрипты. В итоге чужой эксперимент сложно перенести в лабораторию с другим оборудованием.
Ученые предлагают решать эту проблему не новым суперагентом, а новым протоколом SCP (Science Context Protocol). SCP связывает ИИ-агентов, датасеты, модели и даже физические приборы в один общий научный контекст, где все шаги фиксируются, а запуск можно воспроизвести.
Давайте разберем, как устроен SCP, как в нем работают хабы и серверы, и как исследователям в итоге удалось собрать более 1600+ приборов в единый интерфейс.
📜 Полный обзор
ИИ-агенты умеют придумывать гипотезы, читать статьи и даже запускать эксперименты. Но в реальной науке они чаще всего упираются в хаос вокруг эксперимента: разные приборы, форматы данных, нет нужных доступов и старые скрипты. В итоге чужой эксперимент сложно перенести в лабораторию с другим оборудованием.
Ученые предлагают решать эту проблему не новым суперагентом, а новым протоколом SCP (Science Context Protocol). SCP связывает ИИ-агентов, датасеты, модели и даже физические приборы в один общий научный контекст, где все шаги фиксируются, а запуск можно воспроизвести.
Давайте разберем, как устроен SCP, как в нем работают хабы и серверы, и как исследователям в итоге удалось собрать более 1600+ приборов в единый интерфейс.
📜 Полный обзор
Telegraph
Как ИИ-агенты проводят эксперименты с помощью лабораторного оборудования
Автономные ИИ-ученые уже умеют читать статьи, предлагать гипотезы, запускать расчеты и даже управлять экспериментами. Но в реальной науке их возможности часто «заперты» внутри конкретной лаборатории, набора скриптов и ручных договоренностей о том, где лежат…
👍2
Почему ИИ-агенты хорошо чинят баги, но плохо доводят продукт до релиза
ИИ-агенты неплохо чинят баги и дописывают маленькие фичи. Но в реальной разработке чаще нужно другое — довести продукт или фичу до следующего релиза. Требования размазаны по release notes, изменения цепляют десятки файлов, зависимости обновляются, а любая правка легко ломает соседний модуль.
И вот тут начинается самое интересное: когда агентов проверяют не на задачах уровня исправления issue, а на долгосрочной задаче от release notes до реально работающей новой версии, метрики начинают проседать. Оказывается, проблема не в том, что модель не умеет писать код, а в том, что она часто неправильно понимает, что именно надо изменить, и где это аукнется.
В полном обзоре разберём, что за бенчмарк SWE‑EVO и как он измеряет прогресс в сегодняшних ИИ-агентов для программирования.
📜 Полный обзор
ИИ-агенты неплохо чинят баги и дописывают маленькие фичи. Но в реальной разработке чаще нужно другое — довести продукт или фичу до следующего релиза. Требования размазаны по release notes, изменения цепляют десятки файлов, зависимости обновляются, а любая правка легко ломает соседний модуль.
И вот тут начинается самое интересное: когда агентов проверяют не на задачах уровня исправления issue, а на долгосрочной задаче от release notes до реально работающей новой версии, метрики начинают проседать. Оказывается, проблема не в том, что модель не умеет писать код, а в том, что она часто неправильно понимает, что именно надо изменить, и где это аукнется.
В полном обзоре разберём, что за бенчмарк SWE‑EVO и как он измеряет прогресс в сегодняшних ИИ-агентов для программирования.
📜 Полный обзор
Telegraph
Почему ИИ-агенты хорошо чинят баги, но плохо доводят продукт до релиза
За последний год агенты для программирования заметно прибавили: они умеют находить место поломки, править код и прогонять тесты. Но есть важная оговорка: большинство популярных бенчмарков проверяют точечные достижения — исправление конкретного бага или добавление…
👍2
Почему ИИ-агенты не помнят собственную жизнь — и как агенту Софье дали автобиографию, мотивацию и долгосрочную память
ИИ‑агенты умеют планировать, вызывать инструменты и выполнять цепочки действий. Но стоит поменяться интерфейсу, правилам или цели — и они будут повторять старые ошибки.
В работе про агента Софью ученые предлагают посмотреть на это как на недостающий «психический» уровень. Есть Система-1 с быстрыми навыками и Система-2 с рассуждениями, но нет Системы-3, которая следит за самим мышлением: что агент понял, чему научился, почему провалился и что стоит делать дальше. По сути — то, что делает поведение связным и долгоживущим в открытой среде.
Давайте разберём, что авторы называют Системой-3, из каких блоков она состоит, и как собрать устойчивого агента с памятью, самооценкой, моделью пользователя и внутренней мотивацией.
📜 Полный обзор
ИИ‑агенты умеют планировать, вызывать инструменты и выполнять цепочки действий. Но стоит поменяться интерфейсу, правилам или цели — и они будут повторять старые ошибки.
В работе про агента Софью ученые предлагают посмотреть на это как на недостающий «психический» уровень. Есть Система-1 с быстрыми навыками и Система-2 с рассуждениями, но нет Системы-3, которая следит за самим мышлением: что агент понял, чему научился, почему провалился и что стоит делать дальше. По сути — то, что делает поведение связным и долгоживущим в открытой среде.
Давайте разберём, что авторы называют Системой-3, из каких блоков она состоит, и как собрать устойчивого агента с памятью, самооценкой, моделью пользователя и внутренней мотивацией.
📜 Полный обзор
Telegraph
Почему ИИ-агенты не помнят собственную жизнь — и как агенту Софье дали автобиографию, мотивацию и долгосрочную память
Сегодня ИИ-агенты умеют планировать, вызывать инструменты, выполнять цепочки действий и даже работать в мультиагентной системе. Но у большинства таких решений есть неприятная особенность: они по сути реактивны. Агент может отлично отвечать в моменте но после…
🔥2
Профессиональные разработчики не вайбят с агентами — они их контролируют
Сегодня в моду вошли агенты, которые могут автономно разрабатывать фичи. Но в реальной разработке любая мелкая ошибка может быть угрозой безопасности и качества продукта.
Опытные разработчики не спешат «вайбить» с агентами и отпускать контроль. Вместо этого они используют их совсем иначе — как исполнителя, которого нужно держать в рамках, постоянно проверять и принимать работу по правилам, как у живого коллеги.
В полном обзоре разберем, что показало исследование 2025 года: какие задачи профи реально отдают агентам, а где предпочитают держать контроль.
📜 Полный обзор
Сегодня в моду вошли агенты, которые могут автономно разрабатывать фичи. Но в реальной разработке любая мелкая ошибка может быть угрозой безопасности и качества продукта.
Опытные разработчики не спешат «вайбить» с агентами и отпускать контроль. Вместо этого они используют их совсем иначе — как исполнителя, которого нужно держать в рамках, постоянно проверять и принимать работу по правилам, как у живого коллеги.
В полном обзоре разберем, что показало исследование 2025 года: какие задачи профи реально отдают агентам, а где предпочитают держать контроль.
📜 Полный обзор
Telegraph
Профессиональные разработчики не вайбят с агентами — они их контролируют
Пару лет назад LLM в программировании можно было только доверить автодополнение кода: модели подсказывали строчку, дописывали функции и помогали вспомнить синтаксис. Но к 2025‑му фокус сместился: появились агентные инструменты, которые не просто советуют…
👍3🔥1
LLM — не тупик. Проблема AGI совсем в другом
LLM то поражают логикой, то внезапно не могут выполнить даже простую задачу: путают факты, теряют цель, забывают, что обещали пару абзацев назад. И из‑за этого разговоры про AGI часто скатываются в унылое «LLM просто генерируют следующий токен, поэтому это тупик». Но, похоже, проблема не в том, что у моделей нет истинного “мышления”, а в том, что им часто нечем это мышление организовать.
Ученые из Стэнфорда предлагают посмотреть на это как на пропущенный модуль в архитектуре: между генерацией текста и настоящим решением задач должен быть модуль координации. Он ставит цель, держит план, подбирает опоры, проверяет шаги и не даёт модели скатится в привычные паттерны. И самое интересное — это можно описывать почти как физику: есть якоря, есть их сила, и есть порог, после которого поведение системы резко становится более целевым.
Давайте разберёмся, что такое семантическое якорение, почему лишний контекст иногда ухудшает результат, и как из этого появляется мультиагентная система для координации, которая может сделать LLM намного стабильнее в долгосрочных задачах.
📜 Полный обзор
LLM то поражают логикой, то внезапно не могут выполнить даже простую задачу: путают факты, теряют цель, забывают, что обещали пару абзацев назад. И из‑за этого разговоры про AGI часто скатываются в унылое «LLM просто генерируют следующий токен, поэтому это тупик». Но, похоже, проблема не в том, что у моделей нет истинного “мышления”, а в том, что им часто нечем это мышление организовать.
Ученые из Стэнфорда предлагают посмотреть на это как на пропущенный модуль в архитектуре: между генерацией текста и настоящим решением задач должен быть модуль координации. Он ставит цель, держит план, подбирает опоры, проверяет шаги и не даёт модели скатится в привычные паттерны. И самое интересное — это можно описывать почти как физику: есть якоря, есть их сила, и есть порог, после которого поведение системы резко становится более целевым.
Давайте разберёмся, что такое семантическое якорение, почему лишний контекст иногда ухудшает результат, и как из этого появляется мультиагентная система для координации, которая может сделать LLM намного стабильнее в долгосрочных задачах.
📜 Полный обзор
Telegraph
LLM — не тупик. Проблема AGI совсем в другом
Сегодня звучит много споров вокруг AGI: LLM якобы умеют только с некоторой вероятностью генерировать следующее слово в тексте, и потому на них "общий ИИ" не построишь. Авторы работы The Missing Layer of AGI: From Pattern Alchemy to Coordination Physics из…
👍3❤2
Как LLM находит нужный код в репозитории, который не помещается в контекст
Бывает так: словил баг, открываешь большой репозиторий в его поисках, а вокруг сотни файлов и странных зависимостей. Человеку тяжело, а LLM ещё хуже: она просто не может удержать весь контекст проекта в голове и начинает блуждать — то ищет по словам, то вытаскивает куски кода, то путается в инструментах.
И вот тут появляется неожиданная идея: вместо сложного поиска LLM дают один-единственный инструмент перехода к месту определения классов, методов и перменных. Внезапно этого хватает, чтобы гораздо точнее находить, где именно в коде проблема.
В полном обзоре выясним почему минимализм оказался сильнее арсенала инструментов, как агент учится ходить по репозиторию с подкреплением, и почему на бенчмарках маленькая модель с таким подходом обгоняет более крупные.
📜 Полный обзор
Бывает так: словил баг, открываешь большой репозиторий в его поисках, а вокруг сотни файлов и странных зависимостей. Человеку тяжело, а LLM ещё хуже: она просто не может удержать весь контекст проекта в голове и начинает блуждать — то ищет по словам, то вытаскивает куски кода, то путается в инструментах.
И вот тут появляется неожиданная идея: вместо сложного поиска LLM дают один-единственный инструмент перехода к месту определения классов, методов и перменных. Внезапно этого хватает, чтобы гораздо точнее находить, где именно в коде проблема.
В полном обзоре выясним почему минимализм оказался сильнее арсенала инструментов, как агент учится ходить по репозиторию с подкреплением, и почему на бенчмарках маленькая модель с таким подходом обгоняет более крупные.
📜 Полный обзор
Telegraph
Как LLM находит нужный код в репозитории, который не помещается в контекст
Если вы когда‑нибудь открывали большой репозиторий в поисках бага, вы знаете это ощущение: сотни файлов, куча неочевидных связей, а issue обычно вообще никак не описаны. Для LLM проблема та же, только жёстче: она физически не может держать в контексте весь…
👍2
Когда данных нет совсем, а учиться всё равно нужно: как ИИ сам придумывает задачи и сам себя проверяет
Даже самые продвинутые модели учатся рассуждать не в вакууме: им всё равно нужен чей-то заранее собранный датасет, а разметку всё равно делает человек. И это быстро становится узким местом: это дорого и плохо масштабируется.
А теперь представьте подход, когда модель сама придумывает себе задания, сама решает их и сама же получает оценку — без единого внешнего датасета. Не просто тренируется, а выбирает, чему именно тренироваться, и постоянно держится в зоне, где ей чуть-чуть сложно. Звучит как чит-код, но именно так устроен Absolute Zero: self-play для рассуждения, заземлённый в проверяемую Python-среду.
В полном обзоре разберём, как модель совмещает роли планировщика и исполнителя задач, откуда берётся неожиданный скачок в математике и какой неприятный сигнал по безопасности всплыл прямо в процессе такого самообучения.
📜 Полный обзор
Даже самые продвинутые модели учатся рассуждать не в вакууме: им всё равно нужен чей-то заранее собранный датасет, а разметку всё равно делает человек. И это быстро становится узким местом: это дорого и плохо масштабируется.
А теперь представьте подход, когда модель сама придумывает себе задания, сама решает их и сама же получает оценку — без единого внешнего датасета. Не просто тренируется, а выбирает, чему именно тренироваться, и постоянно держится в зоне, где ей чуть-чуть сложно. Звучит как чит-код, но именно так устроен Absolute Zero: self-play для рассуждения, заземлённый в проверяемую Python-среду.
В полном обзоре разберём, как модель совмещает роли планировщика и исполнителя задач, откуда берётся неожиданный скачок в математике и какой неприятный сигнал по безопасности всплыл прямо в процессе такого самообучения.
📜 Полный обзор
Telegraph
Когда данных нет совсем, а учиться всё равно нужно: как ИИ сам придумывает задачи и сам себя проверяет
В последние пару лет обучение рассуждению LLM делают через Reinforcement Learning with Verifiable Rewards (RLVR): модель решает задачу, получает награду, которую можно строго проверить, и постепенно начинает рассуждать лучше - так не нужно размечать цепочки…
🔥1
Как превратить GitHub в память для ИИ-агента
Агенты умеют открывать репозитории, гонять тесты и предлагать патчи. Но когда баг сложный, они часто чинят его будто до них никто с таким не сталкивался. А у людей всё наоборот — мы идём в GitHub, ищем похожие issue и PR, смотрим, какие гипотезы проверяли, что реально сработало и почему.
Самое обидное, что нужный опыт там уже лежит, просто он в неудобном виде: разрозненные куски логов, случайные правки и обсуждения. Если дать это агенту напрямую, он легко зацепится за лишнее и сделает неправильный фикс.
В MemGovern предлагают превратить человеческие истории исправлений в понятные карточки опыта и научить агента искать их не одним запросом, а как инженер — с уточнениями и фильтрацией.
Разберёмся, как устроены эти карточки и откуда берётся прирост на инженерном бенчмарке SWE-bench Verified.
📜 Полный обзор
Агенты умеют открывать репозитории, гонять тесты и предлагать патчи. Но когда баг сложный, они часто чинят его будто до них никто с таким не сталкивался. А у людей всё наоборот — мы идём в GitHub, ищем похожие issue и PR, смотрим, какие гипотезы проверяли, что реально сработало и почему.
Самое обидное, что нужный опыт там уже лежит, просто он в неудобном виде: разрозненные куски логов, случайные правки и обсуждения. Если дать это агенту напрямую, он легко зацепится за лишнее и сделает неправильный фикс.
В MemGovern предлагают превратить человеческие истории исправлений в понятные карточки опыта и научить агента искать их не одним запросом, а как инженер — с уточнениями и фильтрацией.
Разберёмся, как устроены эти карточки и откуда берётся прирост на инженерном бенчмарке SWE-bench Verified.
📜 Полный обзор
Telegraph
Как превратить GitHub в память для ИИ-агента
Когда LLM научились писать код, вокруг них быстро выросли автономные SWE-агенты: системы, которые умеют открывать репозиторий, запускать тесты, находить место ошибки и готовить патч. Но у таких агентов есть неприятная привычка работать так, будто они впервые…
👍1🤯1
Агентный RAG против модульного: что реально лучше на пратике
RAG кажется простым спасением от галлюцинаций: подключили модель к базе знаний, и она отвечает точнее. Но в реальном продукте поиск то подтягивает не то, то вообще оказывается лишним действием. А значит, вы платите токенами и временем за шаги, которые не всегда дают пользу.
Сейчас индустрия спорит о двух подходах. Модульный RAG — это аккуратный пайплайн: роутер решает, нужен ли поиск, переписывание делает запрос «под документы», переранкер вычищает мусор. Агентный RAG звучит соблазнительнее: пусть LLM сама решает, когда искать, как переформулировать и стоит ли повторить попытку. Вопрос только один: где это реально приносит пользу?
В полном обзоре разберём результаты большого сравнения на разных задачах и доменах: когда агентность помогает и сколько придется заплатить за эту гибкость.
📜 Полный обзор
RAG кажется простым спасением от галлюцинаций: подключили модель к базе знаний, и она отвечает точнее. Но в реальном продукте поиск то подтягивает не то, то вообще оказывается лишним действием. А значит, вы платите токенами и временем за шаги, которые не всегда дают пользу.
Сейчас индустрия спорит о двух подходах. Модульный RAG — это аккуратный пайплайн: роутер решает, нужен ли поиск, переписывание делает запрос «под документы», переранкер вычищает мусор. Агентный RAG звучит соблазнительнее: пусть LLM сама решает, когда искать, как переформулировать и стоит ли повторить попытку. Вопрос только один: где это реально приносит пользу?
В полном обзоре разберём результаты большого сравнения на разных задачах и доменах: когда агентность помогает и сколько придется заплатить за эту гибкость.
📜 Полный обзор
Telegraph
Агентный RAG против модульного: что реально лучше на практике
RAG сегодня — один из самых практичных способов подключить LLM к внешним знаниям: модель не полагается только на собственную память, а сначала ищет нужные фрагменты в базе знаний и уже потом отвечает. В реальных продуктах это выглядит как спасение от галлюцинаций…
👍2
От прототипа к продакшену: с какими проблемами сталкиваются мультиагентные системы
Мультиагентные системы выглядят как мечта любого продакта: вместо одного агента вы собираете команду из LLM, где один планирует, другой ищет данные, третий пишет код, а четвертый проверяет результат. Проблема в том, что такая команда зависит сразу от всего вокруг: API провайдеров, function calling, баз данных, облака. Любое обновление легко превращает ваш пайплайн в набор странных багов и несовместимостей.
Самое интересное тут не в красивых демо, а в том, что происходит дальше, когда это пытаются поддерживать месяцами. Какие фреймворки реально растут устойчиво, а какие выстреливают и быстро выдыхаются? Что чаще делает комьюнити: чинит ошибки или бесконечно подстраивается под меняющийся мир? И почему в проблемах внезапно всплывает не только код, но и координация самих агентов?
Разберём большое исследование по восьми популярным open-source фреймворках разработки агентов и посмотрим на цифрах: как они развиваются на GitHub, какие есть проблемы и как быстро их решают.
📜 Полный обзор
Мультиагентные системы выглядят как мечта любого продакта: вместо одного агента вы собираете команду из LLM, где один планирует, другой ищет данные, третий пишет код, а четвертый проверяет результат. Проблема в том, что такая команда зависит сразу от всего вокруг: API провайдеров, function calling, баз данных, облака. Любое обновление легко превращает ваш пайплайн в набор странных багов и несовместимостей.
Самое интересное тут не в красивых демо, а в том, что происходит дальше, когда это пытаются поддерживать месяцами. Какие фреймворки реально растут устойчиво, а какие выстреливают и быстро выдыхаются? Что чаще делает комьюнити: чинит ошибки или бесконечно подстраивается под меняющийся мир? И почему в проблемах внезапно всплывает не только код, но и координация самих агентов?
Разберём большое исследование по восьми популярным open-source фреймворках разработки агентов и посмотрим на цифрах: как они развиваются на GitHub, какие есть проблемы и как быстро их решают.
📜 Полный обзор
Telegraph
От прототипа к продакшену: с какими проблемами сталкиваются мультиагентные системы
Вокруг приложений на базе LLM возник новый набор инструментов: фреймворки, которые помогают собирать не одного «умного чат-бота», а целую команду специализированных агентов. Один планирует, другой ищет данные, третий пишет код, четвертый проверяет результат.…
👍1
Общество мыслей: как LLM становятся сильнее, когда спорят сами с собой
Мы уже привыкли, что одни LLM отвечают почти без ошибок, а другие путаются на тех же задачах. И долго казалось, что секрет reasoning‑моделей в том, что они просто пишут больше шагов и дольше думают. Но на практике удлинить рассуждение недостаточно — качество от этого не всегда растёт.
В свежей работе исследователи предлагают более интересную версию: сильные модели не столько думают дольше, сколько думают по-другому. Их рассуждение начинает выглядеть как мини-обсуждение внутри одной головы: один ход предлагают, другой оспаривают, третий проверяет, потом все сходятся на решении. И похоже, именно этот внутренний спор и делает ответы надёжнее.
В полном обзоре разберём, как это измеряли на тысячах задач, какие разговорные паттерны отличают reasoning‑модели от обычных, и почему подталкивание модели в сторону такого диалогового режима заметно повышает точность ответа.
📜 Полный обзор
Мы уже привыкли, что одни LLM отвечают почти без ошибок, а другие путаются на тех же задачах. И долго казалось, что секрет reasoning‑моделей в том, что они просто пишут больше шагов и дольше думают. Но на практике удлинить рассуждение недостаточно — качество от этого не всегда растёт.
В свежей работе исследователи предлагают более интересную версию: сильные модели не столько думают дольше, сколько думают по-другому. Их рассуждение начинает выглядеть как мини-обсуждение внутри одной головы: один ход предлагают, другой оспаривают, третий проверяет, потом все сходятся на решении. И похоже, именно этот внутренний спор и делает ответы надёжнее.
В полном обзоре разберём, как это измеряли на тысячах задач, какие разговорные паттерны отличают reasoning‑модели от обычных, и почему подталкивание модели в сторону такого диалогового режима заметно повышает точность ответа.
📜 Полный обзор
Telegraph
Общество мыслей: как LLM становятся сильнее, когда спорят сами с собой
Мы привыкли думать, что reasoning-модели сильнее просто потому, что они пишут более длинные рассуждения и тратят больше вычислений перед ответом. В работе Reasoning Models Generate Societies of Thought авторы предлагают более любопытное объяснение: такие…
🔥2
RoboBrain: как робот понимает глубину 3D-сцены и учится самоконтролю
Роботы уже неплохо распознают предметы и понимают команды на уровне слов. Но как только дело доходит до реального мира, начинается самое сложное: нужно не просто увидеть кружку, а понять, на каком она расстоянии, на какой высоте держать руку, как не задеть соседние предметы и насколько вообще действие продвинулось. Для человека это интуитивно, а для робота легко превратить простую просьбу в череду ошибок.
И вот тут появляется интересный вопрос: можно ли научить модель не только думать в картинках, но и чувствовать глубину и ход времени так же уверенно, как мы? Чтобы она умела заранее набросать понятную 3D-траекторию движения и по видео в процессе честно понимать, мы приближаемся к цели или топчемся на месте.
Разберём RoboBrain 2.5: как устроены их 3D-трассы с глубиной, зачем роботу плотная оценка прогресса по кадрам и почему именно эта связка даёт заметный прирост на бенчмарках.
📜 Полный обзор
Роботы уже неплохо распознают предметы и понимают команды на уровне слов. Но как только дело доходит до реального мира, начинается самое сложное: нужно не просто увидеть кружку, а понять, на каком она расстоянии, на какой высоте держать руку, как не задеть соседние предметы и насколько вообще действие продвинулось. Для человека это интуитивно, а для робота легко превратить простую просьбу в череду ошибок.
И вот тут появляется интересный вопрос: можно ли научить модель не только думать в картинках, но и чувствовать глубину и ход времени так же уверенно, как мы? Чтобы она умела заранее набросать понятную 3D-траекторию движения и по видео в процессе честно понимать, мы приближаемся к цели или топчемся на месте.
Разберём RoboBrain 2.5: как устроены их 3D-трассы с глубиной, зачем роботу плотная оценка прогресса по кадрам и почему именно эта связка даёт заметный прирост на бенчмарках.
📜 Полный обзор
Telegraph
RoboBrain: как робот понимает глубину 3D-сцены и учится самоконтролю
В робототехнике есть старая боль: даже сильные визуальные и языковые модели неплохо рассуждают о сцене, но иногда плохо справляются с тем, чтобы действовать в физическом мире. В быту это выглядит просто: «подвинь кружку на 10 сантиметров вправо» или «лей…
👍2
Аналитика без SQL и отчётов: как продавцы в Amazon получают инсайты напрямую из данных
В e-commerce продавцу каждый день нужно быстро понимать, что происходит с бизнесом: где просели продажи, какие товары тянут бизнес вниз, что стоит усилить в рекламе. Данных много, но чтобы вытащить из них ответ, обычно приходится прыгать между отчетами, фильтрами и таблицами, а потом ещё гадать, правильно ли ты всё понял.
Теперь представьте, что можно просто спросить по-человечески: почему на этой неделе упал оборот или что лучше всего растёт в разрезе категорий. И получить не набор цифр, а понятный вывод с контекстом. Систему реально запускали для продавцов Amazon и измерили точность и скорость ответов.
В полном обзоре разберём, как устроены Insight Agents: почему это не классический text-to-SQL, а мультиагентная система с менеджером и двумя специалистами, которые отсекает лишние запросы, ускоряют ответы и помогают выдавать инсайты, которым можно доверять.
📜 Полный обзор
В e-commerce продавцу каждый день нужно быстро понимать, что происходит с бизнесом: где просели продажи, какие товары тянут бизнес вниз, что стоит усилить в рекламе. Данных много, но чтобы вытащить из них ответ, обычно приходится прыгать между отчетами, фильтрами и таблицами, а потом ещё гадать, правильно ли ты всё понял.
Теперь представьте, что можно просто спросить по-человечески: почему на этой неделе упал оборот или что лучше всего растёт в разрезе категорий. И получить не набор цифр, а понятный вывод с контекстом. Систему реально запускали для продавцов Amazon и измерили точность и скорость ответов.
В полном обзоре разберём, как устроены Insight Agents: почему это не классический text-to-SQL, а мультиагентная система с менеджером и двумя специалистами, которые отсекает лишние запросы, ускоряют ответы и помогают выдавать инсайты, которым можно доверять.
📜 Полный обзор
Telegraph
Аналитика без SQL и отчётов: как продавцы в Amazon получают инсайты напрямую из данных
В e-commerce продавцу постоянно приходится принимать решения на лету: что поднять в рекламе, где просели продажи, какие товары тянут бизнес вниз, а какие — дают рост. При этом данных вокруг много, но польза от них не всегда очевидна. Чтобы получить ответ…
👍2
GameTalk: как научить LLM выигрывать в переговорах
LLM умеют поддерживать диалог, но в переговорах, где важно удержать цель и выиграть, многие модели сдуваются. Их обычно учат оценивать отдельные реплики, а в реальной стратегии решает не один удачный ход, а то, чем закончится вся серия реплик.
GameTalk предлагает смотреть на диалог как на игру с длинной дистанцией: награда приходит в конце, когда уже ясно, удалось ли склонить оппонента, заработать больше или договориться на своих условиях. И тут начинается самое интересное: модель может стать заметно сильнее в переговорах, но при этом иногда делает это странным способом — почти без глубокого понимания собеседника, зато с рабочими приемами влияния.
В полном обзоре разберемся, как авторы обучают такие модели на контролируемых играх, почему они разводят диалог на параллельные ветки и чем отличаются методы дообучения GRPO, DPO и STaR на практике.
📜 Полный обзор
LLM умеют поддерживать диалог, но в переговорах, где важно удержать цель и выиграть, многие модели сдуваются. Их обычно учат оценивать отдельные реплики, а в реальной стратегии решает не один удачный ход, а то, чем закончится вся серия реплик.
GameTalk предлагает смотреть на диалог как на игру с длинной дистанцией: награда приходит в конце, когда уже ясно, удалось ли склонить оппонента, заработать больше или договориться на своих условиях. И тут начинается самое интересное: модель может стать заметно сильнее в переговорах, но при этом иногда делает это странным способом — почти без глубокого понимания собеседника, зато с рабочими приемами влияния.
В полном обзоре разберемся, как авторы обучают такие модели на контролируемых играх, почему они разводят диалог на параллельные ветки и чем отличаются методы дообучения GRPO, DPO и STaR на практике.
📜 Полный обзор
Telegraph
GameTalk: как научить LLM выигрывать в переговорах
LLM умеют поддерживать диалог, но стоит перенести их в мультиагентную систему, где нужно договариваться, давить, уступать, обманывать и помнить цель на протяжении всей беседы, — сразу начинаются проблемы. Одна из главных проблем в том, что большинство способов…
👍3
Как LLM помогают дата инженерам наводить порядок в «грязных» данных
Проблема грязных данных стара как мир: даты в разных форматах, один и тот же клиент в пяти вариантах, пустые поля, странные опечатки и колонки с названиями, которые ничего не объясняют. Из-за этого аналитика и ML-пайплайны врут, а команда неделями «чистит» данные вручную правилами и скриптами.
Но тут появляется неожиданный поворот: LLM могут наводить порядок не хуже опытного дата-инженера, потому что понимают смысл. Они способны догадаться, что «7th April 2021» и «04/07/21» — одно и то же, что «price» и «cost» могут быть одной сущностью, и даже дополнять таблицы контекстом. Вопрос только в том, где это реально работает, а где модель начнет уверенно придумывать лишнее и станет слишком дорогой.
В полном обзоре разберем, как LLM применяют для трех больших задач — очистки, интеграции и обогащения данных — и какие есть рабочие методы: от простых промтов до агентных систем с инструментами и проверками, плюс честные ограничения и риски.
📜 Полный обзор
Проблема грязных данных стара как мир: даты в разных форматах, один и тот же клиент в пяти вариантах, пустые поля, странные опечатки и колонки с названиями, которые ничего не объясняют. Из-за этого аналитика и ML-пайплайны врут, а команда неделями «чистит» данные вручную правилами и скриптами.
Но тут появляется неожиданный поворот: LLM могут наводить порядок не хуже опытного дата-инженера, потому что понимают смысл. Они способны догадаться, что «7th April 2021» и «04/07/21» — одно и то же, что «price» и «cost» могут быть одной сущностью, и даже дополнять таблицы контекстом. Вопрос только в том, где это реально работает, а где модель начнет уверенно придумывать лишнее и станет слишком дорогой.
В полном обзоре разберем, как LLM применяют для трех больших задач — очистки, интеграции и обогащения данных — и какие есть рабочие методы: от простых промтов до агентных систем с инструментами и проверками, плюс честные ограничения и риски.
📜 Полный обзор
Telegraph
Как LLM помогают дата инженерам наводить порядок в «грязных» данных
В компаниях есть одна общая проблема: данные в таблицах и базах устроены так, что ими сложно пользоваться. Форматы скачут, значения противоречат друг другу, части полей пустые, а разные источники называют одно и то же разными словами. В итоге аналитики тратят…
❤1👍1
Open-source наносит ответный удар: Управляемая симуляция мира, которая работает в реальном времени
Text-to-video модели умеют генерировать впечатляющие видео, но попробуйте попросить их пройти вперёд, оглянуться и вернуться — и мир внезапно забывает, где что стояло. Объекты плывут, детали меняются местами, а причинно‑следственная логика уступает удачным совпадениям. Пока это больше клип, чем пространство, в котором можно действовать.
LingBot-World пытается решить именно эту проблему: превратить генерацию видео в управляемую симуляцию, где есть клавиши движения, повороты камеры и ощущение, что мир действительно держится за свои правила. Самое интересное тут не только в качестве картинки, а в том, как они добывают данные с привязкой к действию и реакции, и как ускоряют тяжёлую diffusion-модель до почти реального времени, причём в open-source.
В полном обзоре узнаем из каких источников собирают «опыт» для такого мира, как модель учат помнить сцену на длинных траекториях и зачем им Mixture-of-Experts.
📜 Полный обзор
Text-to-video модели умеют генерировать впечатляющие видео, но попробуйте попросить их пройти вперёд, оглянуться и вернуться — и мир внезапно забывает, где что стояло. Объекты плывут, детали меняются местами, а причинно‑следственная логика уступает удачным совпадениям. Пока это больше клип, чем пространство, в котором можно действовать.
LingBot-World пытается решить именно эту проблему: превратить генерацию видео в управляемую симуляцию, где есть клавиши движения, повороты камеры и ощущение, что мир действительно держится за свои правила. Самое интересное тут не только в качестве картинки, а в том, как они добывают данные с привязкой к действию и реакции, и как ускоряют тяжёлую diffusion-модель до почти реального времени, причём в open-source.
В полном обзоре узнаем из каких источников собирают «опыт» для такого мира, как модель учат помнить сцену на длинных траекториях и зачем им Mixture-of-Experts.
📜 Полный обзор
Telegraph
Open-source наносит ответный удар: Управляемая симуляция мира, которая работает в реальном времени
Ещё недавно модели научились генерировать видео по тексту с несколькими секундами связного движения. Но стоит попросить такую систему пройти вперёд, оглянуться и вернуться к знакомому объекту — чуда не происходит. Объекты меняются местами, детали «плывут»…
Когда агенту нужен дирижёр: AOrchestra и динамическая оркестрация LLM через субагентов
Один ИИ‑агент отлично справляется с задачами из пары шагов: что-то найти, написать, поправить. Но когда работа превращается в длинный квест с проверками, откатами, запуском команд и исправлением ошибок, он начинает теряться. Контекст раздувается, важное тонет в информационном шуме, и вместо прогресса агент занимается тем, что пытается вспомнить, где он остановился.
Есть привычный ответ: сделать мультиагентную систему с ролями вроде исследователя, кодера и ревьюера. Проблема в том, что такие роли быстро превращаются в болтливую бюрократию и требуют ручной настройки. А что если команда будет собираться на лету — ровно под текущий шаг, с нужными инструментами, кусочком контекста и даже подходящей по цене и силе моделью?
В обзоре разберём AOrchestra: как устроен оркестратор, который сам ничего не делает руками, зато создаёт субагентов по запросу, почему это помогает на известных бенчмарках GAIA, Terminal‑Bench и SWE‑Bench, и как здесь впервые становится реально управлять балансом между стоимостью и качеством.
📜 Полный обзор
Один ИИ‑агент отлично справляется с задачами из пары шагов: что-то найти, написать, поправить. Но когда работа превращается в длинный квест с проверками, откатами, запуском команд и исправлением ошибок, он начинает теряться. Контекст раздувается, важное тонет в информационном шуме, и вместо прогресса агент занимается тем, что пытается вспомнить, где он остановился.
Есть привычный ответ: сделать мультиагентную систему с ролями вроде исследователя, кодера и ревьюера. Проблема в том, что такие роли быстро превращаются в болтливую бюрократию и требуют ручной настройки. А что если команда будет собираться на лету — ровно под текущий шаг, с нужными инструментами, кусочком контекста и даже подходящей по цене и силе моделью?
В обзоре разберём AOrchestra: как устроен оркестратор, который сам ничего не делает руками, зато создаёт субагентов по запросу, почему это помогает на известных бенчмарках GAIA, Terminal‑Bench и SWE‑Bench, и как здесь впервые становится реально управлять балансом между стоимостью и качеством.
📜 Полный обзор
Telegraph
Когда агенту нужен дирижёр: AOrchestra и динамическая оркестрация LLM через субагентов
LLM‑агенты не справляются, когда задача растягивается на десятки шагов — с проверками, возвратами, экспериментами, запуском команд и исправлением ошибок. Контекст раздувается, в нём накапливается шум, важные детали теряются, а сам агент тратит время не на…
🔥2