OpenAI заявила про масштабний результат у сфері автоматизованого наукового пошуку. Нова, ще не представлена широкій публіці модель штучного інтелекту нібито підготувала сотні математичних розв’язань, використовуючи один основний запит із набором підказок. За словами розробників, система працювала не лише з відомими прикладами, а й із проблемами, які потребують складних міркувань, побудови доказів і перевірки кожного логічного кроку.
Компанія оприлюднила архів із 722 науковими роботами, у яких містяться розв’язання 372 складних задач. Матеріали охоплюють фундаментальну математику, теоретичну інформатику та математичну фізику. Така кількість результатів привернула увагу не тільки технологічної індустрії, а й професійних математиків, адже йдеться про сфери, де остаточна відповідь часто вимагає років роботи, глибокої спеціалізації та незалежної перевірки.
Що саме продемонструвала нова модель
OpenAI описує експеримент як спробу перевірити, чи може сучасна система штучного інтелекту самостійно знаходити нові математичні ідеї, а не просто відтворювати вже знайомі шаблони. Модель отримувала загальні інструкції, після чого аналізувала велику кількість задач, формувала можливі підходи та відкидала варіанти, які не приводили до переконливого результату.
Серед заявлених досягнень розробники називають прогрес у чотиривимірній гіпотезі Какеї. Ця проблема належить до геометричного аналізу та пов’язана з поведінкою множин напрямків у багатовимірному просторі. Навіть частковий результат у такій галузі може мати значення для подальших досліджень, однак його цінність залежить від точності формулювання, новизни і повноти доказу.
Іншим напрямом стали основні алгоритми теоретичної інформатики. ШІ нібито запропонував способи покращення підходів, які використовують для аналізу обчислювальної складності, оптимізації та роботи з великими наборами даних. У перспективі подібні відкриття можуть вплинути на створення ефективнішого програмного забезпечення, систем шифрування та методів машинного навчання.
Окремо OpenAI згадує просування в напрямку складної гіпотези Рімана. Водночас це формулювання не означає, що модель повністю розв’язала одну з найвідоміших нерозв’язаних проблем математики. Найімовірніше, йдеться про нові проміжні спостереження, допоміжні твердження або альтернативний спосіб аналізу окремих аспектів гіпотези. Для наукової спільноти різниця між перспективним кроком і повним доказом є принциповою.
За даними компанії, модель перевірила приблизно 4000 задач. На створення одного успішного розв’язання могло знадобитися близько трьох годин обчислень на потужностях рівня платної версії ChatGPT Pro. Це свідчить, що результат не був миттєвою відповіддю на запит користувача. За простим формулюванням «один промпт» стояла масштабна серія внутрішніх обчислень, повторних спроб, оцінювання помилок і відбору найкращих варіантів.
Важливою частиною публікації стали формалізовані докази мовою програмування Lean. Такий підхід дає змогу переводити математичні міркування у формат, який може перевірити спеціальна система. Якщо формалізація виконана коректно, програма здатна виявити пропущений крок, суперечність або використання твердження, яке не було доведено раніше.
Чому заява про один запит викликає сумніви
Попри вражаючі цифри, науковці обережно оцінюють повідомлення OpenAI. Головна причина полягає в тому, що компанія поки не відкрила саму модель для незалежного тестування. Без доступу до системи інші дослідники не можуть повторити експеримент у тих самих умовах, перевірити її поведінку на нових задачах і з’ясувати, наскільки результат залежить від прихованих налаштувань.
Фраза «один запит» може створювати надто спрощене уявлення про процес. Один текстовий запит не обов’язково означає один крок або одну спробу. Усередині моделі могли відбуватися тисячі циклів міркування, автоматичні перевірки, звернення до внутрішніх інструментів і повторне формування доказу. Тому для коректної оцінки потрібно знати не лише зміст початкової інструкції, а й усю архітектуру експерименту.
Додаткове питання стосується самих підказок. OpenAI не розкрила детальні тексти всіх інструкцій, які використовувалися під час генерації матеріалів. Якщо запит містив спеціально підібрані стратегії, приклади, обмеження або вказівки щодо конкретних методів, тоді його не можна порівнювати зі звичайним коротким зверненням користувача до чат-бота.
Математики також звертають увагу на відсутність повної інформації про обчислювальні витрати для кожної задачі. Середнє значення у три години не показує, скільки невдалих спроб передувало успішному результату. Одна задача могла бути розв’язана швидко, тоді як інша потребувала значно більшого обсягу ресурсів. Для наукової оцінки важливі розподіл часу, кількість повторів і критерії, за якими система визнавала доказ прийнятним.
Формальна перевірка в Lean теж не автоматично підтверджує наукову новизну результату. Вона може засвідчити, що певний ланцюжок тверджень логічно узгоджений із заданими аксіомами та бібліотеками. Проте окремо потрібно встановити, чи справді доказ містить нову ідею, чи правильно сформульована задача та чи не використано вже відомий результат під новою назвою.
Що це означає для науки та розвитку ШІ
Якщо заявлені результати підтвердяться незалежними фахівцями, це стане важливим сигналом для всієї наукової екосистеми. Штучний інтелект зможе виконувати роль не тільки помічника для пошуку інформації або написання коду, а й партнера у формуванні гіпотез. Він може швидко переглядати тисячі можливих напрямів, знаходити нетипові зв’язки між твердженнями та пропонувати підходи, які людина не розглядала.
Водночас це не означає, що математики стануть непотрібними. Людські дослідники визначають, які питання мають наукову цінність, формулюють поняття, оцінюють значення відкриття та пояснюють його наслідки. ШІ здатен прискорити технічну частину роботи, але інтерпретація результату, перевірка припущень і відповідальність за публікацію залишаються критично важливими.
Ситуація також показує, наскільки важливою стає прозорість у розробці передових моделей. Компаніям недостатньо повідомити кількість розв’язаних задач або оприлюднити добірку текстів. Для довіри необхідні докладний опис методики, доступ до вихідних даних, пояснення використаних інструментів і можливість відтворити експеримент у незалежних лабораторіях.
Науковці побоюються, що гучні формулювання можуть випереджати реальне значення досягнення. Якщо кожен проміжний результат називати проривом, це ускладнює відокремлення справді нових відкриттів від якісної автоматизації вже відомих процедур. Саме тому заяви OpenAI, навіть підкріплені формалізованими доказами, потребують ретельної перевірки та професійного обговорення.
Публікація 722 робіт може стати важливим етапом у розвитку математичного штучного інтелекту, але остаточні висновки робити зарано. Поки незалежні дослідники не перевірять методи, повторять ключові результати та не отримають доступ до самої моделі, твердження про розв’язання сотень складних задач одним запитом залишатиметься передусім заявою розробників. Найближчі роки покажуть, чи зможе ШІ стабільно генерувати справді нові математичні ідеї, чи його головною перевагою залишиться швидке комбінування вже наявних знань.
Anthropic оновила правила для Claude: без образ, маніпуляцій і розробки зброї