GPT-6 Sol и Luna: что перепроверить после исправления работы с изображениями
OpenAI исправила ошибку кодирования изображений в GPT-6 Sol и Luna. Как повторить проверку скриншотов, OCR и графиков, сохранив сопоставимые условия.
Обновление OpenAI от 25 сентября 2026 года исправляет ошибку кодирования изображений, которая ухудшала их понимание в GPT-6 Sol и GPT-6 Luna. Если раньше модель не справилась со скриншотом, изображением документа или визуальной автоматизацией, повторите ту же задачу, прежде чем делать вывод о непригодности модели. В официальном журнале изменений API указаны визуальные задачи в API и Codex, включая управление компьютером.
Это повод пересмотреть оценки работы с изображениями, но не доказательство устранения всех жалоб на программирование. Ниже — воспроизводимая процедура повторной проверки. Здесь нет бенчмарка Ofox или измеренного прироста относительно старой версии.
Что известно об исправлении
| Вопрос | Что следует из сообщения |
|---|---|
| Какие модели названы? | GPT-6 Sol и GPT-6 Luna |
| Что исправлено? | Ошибка кодирования изображений, ухудшавшая их понимание |
| Какие сценарии затронуты? | Визуальные задачи API и Codex, включая управление компьютером |
| Указан ли процент улучшения? | В цитируемом сообщении его нет |
| Получили ли все сторонние маршруты обновление одновременно? | Сообщение этого не устанавливает |
Имя модели — лишь часть протокола оценки. Сохраните также маршрут провайдера, время запуска, предобработку изображения, запрос, настройки рассуждений и инструменты. Если шлюз меняет картинку перед отправкой, оставшаяся ошибка может возникать при этом преобразовании.
Для выбора конфигурации под другие задачи пригодится руководство по уровню рассуждений Sol. Этот выбор следует отделять от конкретной ошибки обработки изображений.
Подготовьте небольшой набор с проверяемыми ответами
Возьмите изображения из нужного вам рабочего процесса. Используйте только материалы, которые разрешено передавать провайдеру, и предварительно удалите личные данные. Сохраните оригинал: повторная пересылка скриншота через мессенджеры может менять файл.
| Проверка | Пример вопроса | Проверяемый результат |
|---|---|---|
| Чтение скриншота | Какой элемент управления недоступен? | Точная подпись и видимое состояние |
| OCR документа | Какой номер у счёта? | Точные символы, включая начальные нули |
| Чтение графика | Какой ряд выше в последней точке? | Верный ряд и положение; указание на неуверенность, если изображение неразборчиво |
| Визуальная навигация | Где находится нужная кнопка? | Положение, проверяемое по тому же скриншоту |
Это предлагаемые примеры, а не выполненные тесты. Для каждого нужного сценария добавьте простое и сложное изображение. У размытого или обрезанного источника допустим ответ «невозможно прочитать»: выдумка не считается успешным извлечением.
До запуска запишите ожидаемые ответы и допуски. В OCR решите, важны ли пробелы и пунктуация. Для графиков отделите точные значения от оценки по шкале. В навигации определите, оцениваете ли только распознавание или ещё и последующее действие инструмента.
Повторите запуск, сохранив условия
- Запишите время, точный ID модели и эндпоинт провайдера. Для Codex добавьте версию клиента, выбранную модель, уровень рассуждений и настройки инструментов.
- Не меняйте байты и порядок изображений, вопрос и формат ответа. Сохраните SHA-256 каждого входного файла.
- Используйте одинаковые настройки для сравниваемых моделей. Если одна не поддерживает параметр, явно запишите отличие.
- Повторите каждый пример несколько раз, если изменчивость ответа влияет на решение. Сохраните все ответы, включая ошибки и отказы.
- Оцените ответы по заранее записанным критериям. Задержку и сообщённый расход учитывайте отдельно от правильности.
Без сохранённых результатов до исправления нельзя заявлять об улучшении «до и после». Если старого запуска нет, назовите таблицу «оценка после исправления» и сравнивайте только реально полученные ответы. Восстановленный по памяти неудачный ответ не является исходным измерением.
Для краткого протокола подойдёт CSV:
run_time_utc,provider,model,client_version,effort,image_sha256,case_id,expected,actual,correct,latency_ms,request_id
Это предложенный формат журнала, а не схема ответа провайдера. Не помещайте в него ключи API или приватные URL изображений. Исходные ответы храните отдельно с ограниченным доступом.
Если модель всё ещё неверно понимает изображение
Перед сменой провайдера проверьте входные данные. Откройте именно отправленный файл, посмотрите размеры и убедитесь, что мелкая подпись осталась читаемой. В запросе должна быть часть с изображением, а не только текстовое упоминание локального имени файла. Если используется URL, провайдер должен получать изображение без вашей браузерной сессии.
Отделите распознавание от действия. Попросите модель сначала описать цель и её видимое состояние, а затем нажать на неё инструментом. Правильное описание с неудачным нажатием — другая проблема, чем неправильное описание. При извлечении данных проверьте, не потеряло ли приложение поле при разборе ответа.
Сравните фактический исходящий запрос с поддерживаемым форматом изображений. Успешный текстовый запрос не подтверждает работоспособность передачи картинки. Для прямых запросов к OpenAI используйте руководство по зрению, для шлюза — документацию его маршрута.
Решите, подходит ли конфигурация вашей задаче
Оценка после исправления отвечает на узкий вопрос: выполнены ли критерии приёмки для ваших скриншотов или документов? Одно правильно прочитанное чистое изображение графика не доказывает надёжную навигацию по всему приложению.
При сравнении затрат сохраните реальный расход и маршрут, не оценивайте токены по размеру файла картинки. В руководстве по стоимости Sol API объясняется раздельный учёт ввода, вывода и кэша. Процедура выше не предполагает новых цен или скидок.
Часто задаваемые вопросы
- Теперь Sol или Luna лучше Astra в визуальных задачах?
- Сообщение подтверждает исправление ошибки, а не контролируемое сравнение с Astra. Для сравнения нужны одинаковые изображения, критерии и сохранённые настройки.
- Нужно повторять текстовый бенчмарк программирования?
- Исправление касается понимания изображений. Само по себе оно не делает чисто текстовый тест недействительным. Повторяйте его при другом релевантном изменении или обнаруженной проблеме оценки.
- Можно выразить новый результат в процентах улучшения?
- Только при наличии корректного старого измерения и определённой метрики. Без исходного результата сообщайте оценку после исправления отдельно.


