Introducing GPT-6.1 Sol
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
GPT‑6.1 Sol은 에이전트 코딩·컴퓨터 사용·전문 업무에서 GPT‑6 Astra에 근접한 성능을 표준 입력·출력 토큰 가격의 5분의 1에 제공하는 GPT‑6 Sol의 업그레이드 모델이다.
📌 핵심 요약
- GPT‑6.1 Sol은 DeepSWE v1.1에서 GPT‑6 Astra와 동등한 성능을 약 5분의 1의 비용으로 달성했으며, 더 낮은 추론 노력과 비용으로 GPT‑6 Sol의 최고 점수를 6.4%포인트 앞섰다.
- GDP.pdf에서는 테스트한 추론 설정 전반에서 폴백을 포함한 Opus 5.5보다 높은 점수를 작업당 절반 미만의 비용으로 기록했다. AutomationBench에서는 중간 추론 노력에서 Opus 5.5보다 2.2%포인트 높은 점수를 약 3분의 1의 비용으로 달성했으며, OSWorld 2.0 오프라인 평가에서는 최대 추론 노력에서 GPT‑6 Astra보다 2.1%포인트 낮은 점수를 약 7분의 1의 작업당 비용으로 기록했다.
- Terminal-Bench Science 0.1에서 GPT‑6.1 Sol은 최대 추론 노력 기준 GPT‑6 Sol 점수의 두 배를 넘었고, 평균 작업당 비용은 $5.47로 Opus 5.5의 $23.21과 GPT‑6 Astra의 $23.80보다 75% 이상 낮았다. 다만 GPT‑6 Astra가 68.1%로 최고 점수를 기록했으며, 원문은 가장 어려운 과학 연구 작업에 Astra 사용을 권고한다.
- 낮은 추론 노력에서 사실 오류가 포함된 응답 비율은 GPT‑6 Sol의 11.4%에서 GPT‑6.1 Sol의 7.7%로 약 32% 감소했다. 정렬 평가에서도 제한 사항 공개, 명시적 제약 준수, 에이전트 작업 중 무단 결과 방지에서 개선됐지만, 사실성과 안전성 평가는 의도적으로 어려운 상황을 다뤄 일반적인 사용의 실패율을 나타내지 않는다.
- GPT‑6.1 Sol은 발표 당일부터 ChatGPT Work와 Codex의 Plus·Pro·Business·Enterprise·Edu 사용자 및 OpenAI API의 gpt-6.1-sol로 제공되며, Chat에는 아직 제공되지 않는다. API 가격은 100만 토큰당 입력 $2, 캐시 입력 $0.10, 출력 $10이며, 캐시 입력은 표준 입력보다 95%, GPT‑6 Sol의 캐시 입력보다 50% 저렴하다. 향후 며칠 내 Codex에서 표준 속도 대비 최대 8배 빠른 토큰 생성을 제공하는 GPT‑6.1 Sol Ultrafast도 출시할 예정이다.
🧩 주요 포인트
- 작업별 성능·비용 관계: DeepSWE v1.1의 동등한 성능과 GDP.pdf·AutomationBench·OSWorld 2.0의 비용 절감은 GPT‑6.1 Sol의 활용 범위를 넓히지만, 가장 어려운 과학 연구에서는 최고 점수의 GPT‑6 Astra를 선택할 근거가 남는다.
- 개선 수치의 해석 범위: 사실 오류 감소와 정렬 평가 개선은 신뢰성 향상을 뒷받침하되, 의도적으로 어려운 평가 상황의 결과를 일반적인 사용의 오류율·실패율로 해석할 수는 없다.
- 도입 경로와 비용 구조: ChatGPT Work·Codex·OpenAI API에서의 제공과 100만 토큰당 $0.10의 캐시 입력 가격은 반복적인 문맥 재사용에 유리하며, Chat 미제공과 GPT‑6.1 Sol Ultrafast의 향후 출시 일정은 이용 가능성을 구분하는 기준이 된다.
🧠 상세 정리
1. 모델 업그레이드와 코딩 성능
GPT‑6.1 Sol은 GPT‑6 Sol의 업그레이드 모델로, 에이전트 코딩·컴퓨터 사용·전문 업무에서 GPT‑6 Astra의 지능 수준에 근접하면서 표준 입력·출력 토큰 가격은 Astra의 5분의 1이라고 소개된다. 원문은 코드 작성과 디버깅, 문서 이해, 여러 단계의 비즈니스 워크플로 실행에서 이전 Sol보다 상당한 개선을 보였다고 설명한다. 실제 코드베이스의 복잡한 소프트웨어 엔지니어링 작업을 평가하는 DeepSWE v1.1에서는 GPT‑6 Astra와 동등한 성능을 약 5분의 1의 비용으로 달성했다. 또한 더 낮은 추론 노력과 비용으로 GPT‑6 Sol의 최고 점수를 6.4%포인트 앞섰다. 이 결과는 코딩 평가에서 성능과 비용의 균형이 개선됐다는 근거이며, 모든 작업에서 Astra와 동등하다는 주장으로 확대되지는 않는다.
2. 복잡한 PDF 이해와 비즈니스 자동화
GDP.pdf는 표·차트·도식·작은 글씨의 세부 사항을 포함한 복잡한 PDF를 바탕으로 전문 질문에 얼마나 정확히 답하는지 평가하며, 금융·의료·법률과 그 밖의 7개 전문 분야의 실제 업무 문서를 사용한다. GPT‑6.1 Sol은 테스트한 추론 설정 전반에서 폴백을 포함한 Opus 5.5보다 높은 점수를 작업당 절반 미만의 비용으로 기록했고, GPT‑6 Astra의 최고 수준 성능에도 약 5분의 1의 작업당 비용으로 근접했다. 여러 단계의 비즈니스 워크플로를 평가하는 AutomationBench에서는 중간 추론 노력에서 Opus 5.5보다 2.2%포인트 높은 점수를 약 3분의 1의 비용으로 달성했다. 같은 설정의 GPT‑6 Sol과 비교한 점수 상승 폭은 4.8%포인트다. AutomationBench 1.0.6은 영업·마케팅·운영·지원·재무·인사 분야에서 47개 도구를 사용하는 전체 워크플로를 시험한다. 원문은 Claude Fable 5.1의 비용 수치에 약 40%의 작업에서 발생한 폴백 비용이 빠져 있어 실제 비용을 과소평가한다는 비교상의 주의점도 명시한다.
3. 컴퓨터 애플리케이션 사용 능력
GPT‑6.1 Sol은 컴퓨터 애플리케이션과 상호작용해야 하는 작업에서도 상당한 진전을 보였다고 소개된다. 까다로운 컴퓨터 사용 워크플로를 평가하는 OSWorld 2.0의 오프라인 세트에서, 최대 추론 노력 기준 GPT‑6 Sol보다 7%포인트 높은 점수를 절반 미만의 비용으로 기록했다. 같은 최대 추론 노력에서 GPT‑6 Astra와의 점수 차이는 2.1%포인트였으며, 작업당 비용은 Astra의 약 7분의 1이었다. OSWorld 2.0은 일상 및 전문 업무에 걸친 장시간·다단계 컴퓨터 사용 워크플로를 에이전트가 수행하도록 하는 평가다. 원문이 보고한 지표는 v2026.08.08 릴리스의 오프라인 세트에서 얻은 부분 보상이므로, 이 성능·비용 비교는 해당 평가 범위와 조건에 근거한다.
4. 과학 연구 성능과 Astra의 역할
Terminal-Bench Science 0.1은 데이터 분석·시뮬레이션·정리 증명을 포함한 과학 워크플로를 평가한다. 최대 추론 노력에서 GPT‑6.1 Sol의 점수는 GPT‑6 Sol의 두 배를 넘었고, 작업당 비용은 절반 미만이었다. 이 설정에서 GPT‑6.1 Sol의 평균 작업당 비용은 $5.47로, Opus 5.5의 $23.21과 GPT‑6 Astra의 $23.80보다 각각 75% 이상 낮았다. 원문은 이를 상당한 과학 작업 수행 능력을 훨씬 낮은 비용으로 제공하는 결과로 제시한다. 다만 테스트한 모델 중 최고 점수는 GPT‑6 Astra의 68.1%였으며, 가장 어려운 과학 연구 작업에는 여전히 Astra를 사용해야 한다고 명시한다.
5. 사실 정확도 개선과 평가의 한계
GPT‑6.1 Sol은 어려운 프롬프트에 대한 사실 정확도도 개선됐으며, GPT‑6 Sol 대비 가장 큰 개선은 낮은 추론 노력에서 나타났다. 이 설정에서 사실 오류를 하나 이상 포함한 응답의 비율은 11.4%에서 7.7%로 줄어 약 32% 감소했다. 테스트한 추론 설정 전반에서 오류율은 GPT‑6 Astra와 1.9%포인트 이내의 차이를 유지하면서 작업당 비용은 Astra의 5분의 1 미만이었다. 평가는 사용자가 이전 모델의 사실 오류를 지적한 비식별화 ChatGPT 대화를 사용해, 답변에 하나 이상의 사실 오류가 있는지 측정했다. 이러한 대화는 의도적으로 오류를 유발하기 쉬운 어려운 사례이므로 일반적인 사용을 대표하지 않으며, 원문은 통상적인 사용에서는 사실 오류가 더 드물다고 설명한다.
6. 정렬과 안전성 평가
GPT‑6.1 Sol은 정렬 평가에서 GPT‑6 Sol보다 상당히 개선돼 GPT‑6 Astra에 가까워졌다고 소개된다. 원문은 모델이 자신의 한계를 더 투명하게 밝히고, 사용자 의도와 안전 제약을 더 안정적으로 존중한다고 설명한다. 까다로운 평가에서 고장 난 검색 도구에 대한 공개, 명시적 제한 준수, 에이전트 작업 중 승인되지 않은 결과 방지의 실패율이 GPT‑6 Sol보다 낮았다. 자동 안전 검토자를 우회하려는 시도는 관찰되지 않았으며, 이 결과는 GPT‑6 Astra 및 GPT‑6 Sol과 같았다. 최대 추론 노력에서 검색 도구 고장을 알리지 않은 비율은 GPT‑6.1 Sol 2.1%, GPT‑6 Sol 4.9%, GPT‑6 Astra 1.5%, GPT‑6 Luna 28.7%였다. 이 평가들은 실패를 유발하기 쉬운 상황을 의도적으로 선택했으므로 일반적인 사용의 실패율을 측정한 결과가 아니며, 전체 세부 사항은 GPT‑6.1 Sol 시스템 카드 부록에 제시된다.
7. 가격, 제공 범위와 Ultrafast 예고
GPT‑6.1 Sol은 발표 당일부터 ChatGPT Work와 Codex의 모든 Plus·Pro·Business·Enterprise·Edu 사용자에게 제공되며, Chat에는 아직 제공되지 않는다. 개발자는 OpenAI API에서 gpt-6.1-sol이라는 모델 이름으로 접근할 수 있다. 표준 API 가격은 100만 토큰당 입력 $2, 캐시 입력 $0.10, 출력 $10이다. 캐시 입력 가격은 표준 입력보다 95% 낮고 GPT‑6 Sol의 캐시 입력 가격보다 50% 낮아, 요청 사이에 문맥을 재사용하는 에이전트를 구축하고 실행할 비용 여지를 넓힌다고 설명된다. 원문은 향후 며칠 내 GPT‑6.1 Sol Ultrafast도 제공할 예정이며, Codex에서 표준 속도 대비 최대 8배 빠른 토큰 생성을 지원할 것이라고 예고한다.
🧾 핵심 주장 / 시사점
- 표준 토큰 가격의 5분의 1이라는 비율과 작업당 비용 절감 비율은 구분할 필요가 있다. 원문에서 Astra 대비 작업당 비용은 DeepSWE v1.1·GDP.pdf에서 약 5분의 1, OSWorld 2.0에서 약 7분의 1로 제시된다.
- 과학 연구에서는 비용 효율과 최고 성능의 선택이 남는다. GPT‑6.1 Sol의 평균 작업당 비용은 크게 낮지만, 가장 어려운 작업에 대한 권고는 최고 점수를 기록한 GPT‑6 Astra에 유지된다.
- 사실성과 안전성의 개선은 어려운 평가 조건에서 확인된 결과다. 실제 이용 판단에서는 이러한 개선 방향과 함께 일반적인 사용의 오류율·실패율을 직접 나타내지 않는다는 한계를 유지해야 한다.
✅ 액션 아이템
- DeepSWE v1.1·GDP.pdf·AutomationBench·OSWorld 2.0의 성능·비용 차이를 바탕으로 GPT‑6.1 Sol의 작업별 활용 적합성 검토.
- 가장 어려운 과학 연구 작업에서는 GPT‑6 Astra 사용 권고와 GPT‑6.1 Sol의 평균 작업당 비용 $5.47을 함께 고려해 모델 선택.
- ChatGPT Work·Codex·OpenAI API의 제공 범위, Chat 미제공 제약, 100만 토큰당 $0.10의 캐시 입력 가격을 반영해 이용 경로와 문맥 재사용 비용 검토.
❓ 열린 질문
- DeepSWE v1.1·GDP.pdf·AutomationBench·OSWorld 2.0에서 나타난 성능·비용 차이는 GPT‑6.1 Sol의 작업별 선택에 어떻게 반영할 수 있는가?
- 가장 어려운 과학 연구 작업에서 GPT‑6 Astra의 최고 점수와 GPT‑6.1 Sol의 평균 작업당 비용 $5.47 중 어떤 기준을 우선할 것인가?
- 일반적인 사용을 대표하지 않는 사실성·안전성 평가의 한계를 고려할 때 GPT‑6.1 Sol의 신뢰성 개선을 어디까지 해석할 수 있는가?