- выпуск рассылки Latent Space (AINews)
По её данным, внутренняя математическая модель OpenAI, ранее показанная на задачах уровня
ИИ заявил о решении 90 из 500 открытых задач. Разбираем, почему ценность модели определяет проверка результата, и что это даёт бизнесу.
OpenAI опубликовала 722 математические работы.
По заявлению компании, они закрывают 90 из 500 самых известных открытых задач.
Один из исследователей конкурирующей лаборатории назвал это самым значимым моментом в математике за последние сто с лишним лет.
Для руководителя, который покупает ИИ ради бизнес-результата, из этой новости следует другое: ценность модели задаёт скорость и надёжность проверки её ответа.
По её данным, внутренняя математическая модель OpenAI, ранее показанная на задачах уровня
К ним приложены блогпост, репозиторий и сообщение в соцсети. Оценку «самый значимый момент»
дал специалист из Anthropic, то есть из лаборатории-конкурента, причём с оговоркой о личных претензиях к OpenAI. Такая оценка весомее самопохвалы.
Независимой верификации всех 722 работ на момент выхода рассылки нет.
Цифры 722 и 90 из 500 принадлежат самой OpenAI, и устоят ли они после проверки математическим сообществом, пока неизвестно.
Пока это гипотеза, и в статье она так и называется.
Доказательство в математике проверяется по формальным правилам: ошибку в рассуждении находит верификатор, и рецензент тут решает меньше.
Поэтому модели в этой области учат по циклу «сгенерировать - проверить - отбросить неверное - повторить».
Масштаб результата станет понятен, когда проверяющие подтвердят или отклонят каждую работу.
В типичной компании у ИИ-проекта нет формального верификатора.
Модель пишет код, описание товара, ответ клиенту, сводку по договору, а проверяет человека, и его время становится узким местом.
Если на проверку ответа уходит столько же времени, сколько ушло бы на самостоятельную работу, выигрыша нет.
Выигрыш измеряется метрикой TTU - time to use: за какое время инструмент выдаёт результат, пригодный к использованию.
Математики получили верификатор от самой науки.
Бизнесу его приходится строить: тесты для кода, схемы и правила для данных, сверку с первоисточником для текстов, ограничения на действия агента.
Цикл «модель предлагает - система проверяет» в корпоративных задачах собирается из нескольких слоёв. ### Проверка по
у RAG привязывает ответ модели к документам компании.
Ответ получает ссылку на фрагмент источника, и проверка сводится к сравнению двух текстов.
Обычно это заметно быстрее, чем перепроверка с нуля. ###
Проверка по правилам В каталогах товаров и в интеграциях верификатором служат схемы, таксономия и бизнес-правила.
Модель заполняет карточку, валидатор отклоняет значение вне допустимого справочника.
Человек разбирает только спорные случаи. ### Контроль доступа и действий
Когда агент обращается к внутренним системам через MCP, каждая операция проходит через шлюз: что можно читать, что писать, какие данные не должны покидать контур. В KT.Team эту роль выполняет LLM & Security Gateway.
Он логирует вызовы и фильтрует чувствительные данные, поэтому работу агента можно аудировать. ###
Разработка с тестами впереди В AI-native development модель генерирует код, а границу качества задают тесты и CI.
Чем плотнее покрытие, тем больше изменений доходит до продакшена без ручной перепроверки.
Простой интерфейс «попросил - получил» держится на тяжёлом слое проверок, и строить этот слой приходится инженерам.
Если часть работ подтвердится, это покажет: связка «генерация плюс автоматическая проверка»
справляется с задачами, которые люди десятилетиями не могли решить.
Если подтвердится малая доля, вывод останется тем же в более скромном масштабе: сгенерированный объём ничего не стоит, пока не измерен объём проверенного.
Для планирования бюджета полезны три вопроса к любому ИИ-проекту: -
Чем проверяется результат модели и сколько это стоит на единицу результата? -
Какая доля ответов проходит проверку без участия человека? -
Какая метрика бизнеса изменилась за квартал?
Проект без ответов на эти вопросы остаётся театром, а театр рано или поздно попадает под сокращение бюджета.
Новость из математики интересна как демонстрация метода, и убедительность метода держится на верификаторе. Компании, которые сначала строят проверку и затем масштабируют генерацию, получают результат раньше тех, кто начинает с объёма. Я бы дождался независимой экспертизы 722 работ, а верификатор в своём проекте построил уже сейчас.
Latent Space, выпуск AINews «Quasi-Riemann-Hypothesis: OpenAI publishes 722 math papers…» - https://www.latent.space/p/ainews-quasi-riemann-hypothesis-openai. Цифры и цитаты приведены по этому выпуску и первичным материалам OpenAI, на которые он ссылается.