722 математические работы от ИИ: что проверить до того, как верить

ИИ заявил о решении 90 из 500 открытых задач. Разбираем, почему ценность модели определяет проверка результата, и что это даёт бизнесу.

  • Что произошло
  • Почему математика удобна для такой проверки
  • Что это значит для бизнеса
  • Как это закрывается технически

Что произошло

  1. OpenAI опубликовала 722 математические работы.

  2. По заявлению компании, они закрывают 90 из 500 самых известных открытых задач.

  3. Один из исследователей конкурирующей лаборатории назвал это самым значимым моментом в математике за последние сто с лишним лет.

  4. Для руководителя, который покупает ИИ ради бизнес-результата, из этой новости следует другое: ценность модели задаёт скорость и надёжность проверки её ответа.

Источник

- выпуск рассылки Latent Space (AINews)

По её данным, внутренняя математическая модель OpenAI, ранее показанная на задачах уровня

Навье - Стокса, выдала массив работ

К ним приложены блогпост, репозиторий и сообщение в соцсети. Оценку «самый значимый момент»

дал специалист из Anthropic, то есть из лаборатории-конкурента, причём с оговоркой о личных претензиях к OpenAI. Такая оценка весомее самопохвалы.

Независимой верификации всех 722 работ на момент выхода рассылки нет.

Цифры 722 и 90 из 500 принадлежат самой OpenAI, и устоят ли они после проверки математическим сообществом, пока неизвестно.

Пока это гипотеза, и в статье она так и называется.

Почему математика удобна для такой проверки

Доказательство в математике проверяется по формальным правилам: ошибку в рассуждении находит верификатор, и рецензент тут решает меньше.

Поэтому модели в этой области учат по циклу «сгенерировать - проверить - отбросить неверное - повторить».

Цифра 722 показывает масштаб генерации

Масштаб результата станет понятен, когда проверяющие подтвердят или отклонят каждую работу.

Что это значит для бизнеса

  1. В типичной компании у ИИ-проекта нет формального верификатора.

  2. Модель пишет код, описание товара, ответ клиенту, сводку по договору, а проверяет человека, и его время становится узким местом.

  3. Если на проверку ответа уходит столько же времени, сколько ушло бы на самостоятельную работу, выигрыша нет.

  4. Выигрыш измеряется метрикой TTU - time to use: за какое время инструмент выдаёт результат, пригодный к использованию.

  5. Математики получили верификатор от самой науки.

  6. Бизнесу его приходится строить: тесты для кода, схемы и правила для данных, сверку с первоисточником для текстов, ограничения на действия агента.

Оценить, где ИИ даст эффект в вашем процессе

Как это закрывается технически

Цикл «модель предлагает - система проверяет» в корпоративных задачах собирается из нескольких слоёв. ### Проверка по

Источник

  1. у RAG привязывает ответ модели к документам компании.

  2. Ответ получает ссылку на фрагмент источника, и проверка сводится к сравнению двух текстов.

  3. Обычно это заметно быстрее, чем перепроверка с нуля. ###

  4. Проверка по правилам В каталогах товаров и в интеграциях верификатором служат схемы, таксономия и бизнес-правила.

  5. Модель заполняет карточку, валидатор отклоняет значение вне допустимого справочника.

  6. Человек разбирает только спорные случаи. ### Контроль доступа и действий

  7. Когда агент обращается к внутренним системам через MCP, каждая операция проходит через шлюз: что можно читать, что писать, какие данные не должны покидать контур. В KT.Team эту роль выполняет LLM & Security Gateway.

  8. Он логирует вызовы и фильтрует чувствительные данные, поэтому работу агента можно аудировать. ###

  9. Разработка с тестами впереди В AI-native development модель генерирует код, а границу качества задают тесты и CI.

  10. Чем плотнее покрытие, тем больше изменений доходит до продакшена без ручной перепроверки.

  11. Простой интерфейс «попросил - получил» держится на тяжёлом слое проверок, и строить этот слой приходится инженерам.

Чего ждать от новости

  1. Если часть работ подтвердится, это покажет: связка «генерация плюс автоматическая проверка»

  2. справляется с задачами, которые люди десятилетиями не могли решить.

  3. Если подтвердится малая доля, вывод останется тем же в более скромном масштабе: сгенерированный объём ничего не стоит, пока не измерен объём проверенного.

  4. Для планирования бюджета полезны три вопроса к любому ИИ-проекту: -

  5. Чем проверяется результат модели и сколько это стоит на единицу результата? -

  6. Какая доля ответов проходит проверку без участия человека? -

  7. Какая метрика бизнеса изменилась за квартал?

  8. Проект без ответов на эти вопросы остаётся театром, а театр рано или поздно попадает под сокращение бюджета.

Вывод

Новость из математики интересна как демонстрация метода, и убедительность метода держится на верификаторе. Компании, которые сначала строят проверку и затем масштабируют генерацию, получают результат раньше тех, кто начинает с объёма. Я бы дождался независимой экспертизы 722 работ, а верификатор в своём проекте построил уже сейчас.

Источник

Latent Space, выпуск AINews «Quasi-Riemann-Hypothesis: OpenAI publishes 722 math papers…» - https://www.latent.space/p/ainews-quasi-riemann-hypothesis-openai. Цифры и цитаты приведены по этому выпуску и первичным материалам OpenAI, на которые он ссылается.

Обсудить статью: 722 математические работы от ИИ: что…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: