안녕하세요!
OpenAI가 GPT-6 Sol과 GPT-6 Luna를 공개했습니다. 이번에 눈에 들어온 부분은 모델 이름보다 가격입니다. GPT-5.6 계열보다 토큰 단가가 내려갔는데, 그렇다면 기존 GPT-5.6을 바꾸고, 비용이 높은 Astra까지 검토할 이유는 무엇일까요?
가격표만 보면 간단해 보입니다. 다만, 실제로는 추론 설정과 작업 종류, 캐시 사용 여부에 따라 이야기가 달라집니다. 이번에는 이 부분을 하나씩 비교해 보겠습니다.
자료 기준: 2026년 9월 23일, 한국시간. 9월 22일자 OpenAI 발표와 현재 API 문서를 기준으로 작성했습니다. 성능 수치는 별도 표시가 없으면 OpenAI가 공개한 평가 결과이며, 제가 직접 실행한 실측 결과는 아닙니다. [1] [2]

그림 1. Sol·Luna·Astra의 역할을 해·달·별에 빗댄 AI 생성 이미지입니다. 실제 모델 구조나 성능을 표현한 도표는 아닙니다.
1. 먼저, 이번에 비교할 모델부터 살펴보겠습니다
이번 비교 대상은 다섯 가지입니다.
- GPT-5.6 Sol / GPT-6 Sol: 이전 세대와 새 세대의 Sol을 비교합니다.
- GPT-5.6 Luna / GPT-6 Luna: 대량 작업에 사용할 때 비용 차이가 큰 Luna를 비교합니다.
- GPT-6 Astra: 비용이 더 들더라도 어려운 작업을 맡길 이유가 있는지 살펴볼 상위 모델입니다.
공식 설명에서 GPT-6 Sol은 복잡한 코딩과 에이전트 작업, Luna는 요약·정보 추출처럼 목표가 뚜렷한 대량 작업에 초점을 둡니다. Astra는 더 어렵고 중요한 작업을 위한 모델로 소개됩니다. 에이전트 작업은 단순히 답변을 생성하는 데서 끝나지 않고, 도구를 호출하거나 여러 단계를 수행하는 작업을 뜻합니다. [1]
이번 세대의 세 모델은 입력할 수 있는 문서 길이보다, 작업을 처리하는 능력과 비용으로 구분하는 편이 이해하기 쉽습니다.
확인한 다섯 모델 모두 컨텍스트 윈도우는 1,050,000토큰, 최대 출력은 128,000토큰입니다. 컨텍스트 윈도우는 입력과 출력 등이 함께 사용하는 문맥의 범위이지, 105만 토큰을 입력하고 여기에 12만 8천 토큰을 별도로 더 출력한다는 의미는 아닙니다.
긴 문서를 넣을 수 있다는 것과 그 내용을 정확히 활용한다는 것도 다른 문제입니다. [3] [4] [5] [6] [7]
추론 강도(reasoning effort)도 구분해야 합니다. Sol·Luna는 none부터 max까지 지원하지만, Astra는 low부터 시작하며 none은 지원하지 않습니다. 같은 모델이라도 추론 강도를 바꾸면 결과와 소비 토큰이 달라질 수 있습니다. [3] [4] [5] [6] [7]
발표 당시 GPT-6 Sol·Luna의 제공 범위는 유료 플랜의 ChatGPT Work와 Codex, 그리고 API입니다. Free·Go 사용자는 데스크톱 앱에서 Luna를 사용할 수 있으며, 일반 Chat에는 아직 제공되지 않는다고 안내했습니다.
단계적 배포이므로 본인 계정의 실제 모델 선택 화면은 별도로 확인해야 합니다. API 가격과 ChatGPT 구독료는 서로 다른 요금입니다. [1]
2. API 가격: Sol은 절반, Luna 출력은 약 58.3% 인하
아래는 Standard 처리, 입력 272,000토큰 이하, 100만 토큰당 미국 달러(USD) 기준입니다. 캐시 읽기는 이전에 저장된 동일한 입력 일부를 재사용할 때의 단가입니다. [2] [3] [4] [5] [6] [7]
| 모델 | 입력 | 캐시 읽기 | 출력 |
|---|---|---|---|
| GPT-5.6 Sol | $4.00 | $0.40 | $20.00 |
| GPT-6 Sol | $2.00 | $0.20 | $10.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
| GPT-6 Luna | $0.10 | $0.01 | $0.50 |
| GPT-6 Astra | $10.00 | $1.00 | $50.00 |
여기서 두 가지를 주의해서 볼 필요가 있습니다.
첫째, GPT-5.6 Sol의 $4 / $20는 프로모션 가격입니다. 문서에는 최소 2026년 11월 21일까지 제공한다고 명시되어 있습니다. 따라서 과거의 $5 / $30 가격을 가져와 현재 가격인 것처럼 비교하지 않았습니다. [5]
둘째, 발표의 “50% 인하”라는 표현을 모든 항목에 그대로 적용하면 안 됩니다. Sol은 입력과 출력 모두 정확히 50% 인하입니다. Luna는 입력이 50% 인하이지만, 출력은 다음과 같습니다.
(1.20 - 0.50) ÷ 1.20 × 100 = 약 58.3% 인하
또한 GPT-6 Sol의 입력·출력 단가는 Astra의 1/5, GPT-6 Luna는 Sol의 1/20입니다. 다만 이는 어디까지나 같은 양의 토큰을 사용했을 때의 단가 비교입니다. 작업 하나를 끝내는 비용이 반드시 같은 비율로 줄어드는 것은 아닙니다.
3. 성능: 싼 모델이 어디까지 따라왔을까요?
코딩, 자동화, 신뢰성은 서로 다른 질문입니다. 점수를 한데 합치기보다 작업별로 나누어 보겠습니다.
비교 기준을 맞추기 위해 아래 두 표는 OpenAI 발표의 max 추론 설정 결과로 통일했습니다. 모델마다 가장 높은 점수만 골라 붙인 표는 아닙니다. max라는 설정 이름을 맞추어도 실제 소비 토큰이나 계산량이 같아지는 것은 아닙니다. 모든 점수는 높을수록 좋습니다. [1]
코딩: 새 Sol이 모든 항목에서 이전 Sol을 이기지는 않습니다
| 모델 | FrontierCode 1.1 | DeepSWE 1.1 |
|---|---|---|
| GPT-5.6 Sol | 47.5% | 72.7% |
| GPT-6 Sol | 49.3% | 68.8% |
| GPT-5.6 Luna | 39.8% | 62.2% |
| GPT-6 Luna | 42.4% | 66.6% |
| GPT-6 Astra | 53.3% | 73.2% |
FrontierCode는 채점 기준별 가중 점수이고, DeepSWE는 첫 시도 통과율(pass@1)입니다. 이름이 비슷한 코딩 평가여도 서로 다른 능력을 측정하므로 두 점수를 평균 내서 종합 순위를 만들지는 않았습니다. [10] [11]
여기서 흥미로운 부분은 GPT-6 Sol입니다. FrontierCode에서는 이전 Sol보다 1.8%p 높지만, DeepSWE에서는 3.9%p 낮습니다. 따라서 “새 세대이므로 코딩 성능이 전부 올랐다”고 정리하면 중요한 부분을 놓치게 됩니다.
반면 Luna는 이 공식 표에서 두 항목 모두 개선되었습니다. 특히 GPT-6 Luna의 DeepSWE 66.6%는 GPT-6 Sol의 68.8%와 2.2%p 차이입니다. 토큰 단가는 훨씬 낮지만, 이 한 항목만으로 Luna가 Sol의 모든 업무를 대체한다고 볼 수는 없습니다.
자동화와 컴퓨터 사용: 역할별로 차이가 있습니다
| 모델 | AutomationBench 1.0.6 | Agents’ Last Exam V1 | OSWorld 2.0 |
|---|---|---|---|
| GPT-5.6 Sol | 28.8% | 52.8% | 66.2% |
| GPT-6 Sol | 32.0% | 56.4% | 64.4% |
| GPT-5.6 Luna | 17.0% | 50.4% | 52.7% |
| GPT-6 Luna | 20.7% | 50.9% | 52.7% |
| GPT-6 Astra | 41.4% | 59.3% | 73.5% |
AutomationBench는 업무 흐름을 정확히 완료했는지 평가합니다. Agents’ Last Exam은 여러 도구와 단계가 필요한 에이전트 과제를 다룹니다. OSWorld 수치는 v2026.08.08 오프라인 세트의 부분 보상(partial reward)으로, 작업을 완전히 성공한 비율과는 다릅니다. [9] [12] [13]
이 표에서도 새 Sol은 자동화와 에이전트 평가에서는 개선되지만, OSWorld에서는 이전 Sol보다 1.8%p 낮습니다. Luna의 OSWorld 점수는 소수 첫째 자리 반올림 기준으로 같습니다.
가격은 낮아졌지만, 성능 향상 폭은 작업별로 다르다는 뜻입니다.
max가 언제나 정답은 아닙니다
발표에서 강조한 GPT-6 Sol의 AutomationBench 33.2%, 시도당 $0.27는 xhigh 설정입니다. 위 표의 max 결과는 32.0%, $0.34입니다. 이 공개 결과에서는 더 높은 추론 설정이 더 높은 점수로 이어지지 않았습니다. [1] [9]
Zapier의 같은 리더보드에서 Astra low는 30.29%, 시도당 $1.08로 표시됩니다. 이 지점만 비교하면 Sol xhigh가 더 높은 점수에 더 낮은 비용을 보입니다. 다만 이것은 Sol 전체가 Astra 전체보다 낫다는 뜻이 아니라, 특정 평가와 추론 설정의 비교입니다. [9]
Astra도 DeepSWE에서 max는 73.2%이지만 xhigh는 74.1%로 보고되었습니다. 작은 차이에는 실행 편차도 있을 수 있으므로, 추론 설정을 올릴수록 반드시 좋아진다고 가정하지 않는 편이 좋겠습니다. [1]
여기서 공개된 달러 금액은 작업 1회 시도당 비용입니다. “성공한 작업 1건당 비용”으로 바꾸어 읽으면 안 됩니다.
공식 차트로 보면 비용과 성능의 관계가 좀 더 잘 보입니다. 왼쪽은 비용이 적고, 위쪽은 점수가 높은 지점입니다. 여러 추론 강도와 다른 회사 모델도 포함한 원본이므로, 위의 max 통일 표와 구분해서 보면 좋겠습니다.

그림 2. OpenAI 공식 AutomationBench 1.0.6 차트. 출처: OpenAI, Introducing GPT-6 Sol and Luna (2026-09-23 확인). 원본의 축·범례를 유지했습니다. 여러 모델과 추론 강도를 포함하며, 가로축은 성공 1건이 아닌 시도당 비용입니다.
독립 리더보드와 확인 범위
AutomationBench와 FrontierCode에서는 새 모델의 결과를 벤치마크 운영 사이트에서도 확인할 수 있었습니다. 다만 이것만으로 모든 결과가 별도의 제3자 재실행으로 검증되었다고 단정하지는 않았습니다. [9] [10]
확인 시점의 DeepSWE와 OSWorld 사이트에는 GPT-6 Sol·Luna 결과가 아직 없었습니다. 이전 모델도 수치 차이가 있습니다. 예를 들어 GPT-5.6 Luna의 DeepSWE는 OpenAI 차트에서 62.2%, 운영 사이트에서는 67%±4%로 표시됩니다.
실행 환경·평가 실행·집계 조건이 같다고 확인되지 않은 값을 한 표에 섞지 않고, 위 표는 OpenAI 발표 기준으로 유지했습니다. [1] [11] [12]
4. 정확성과 신뢰성도 따로 봐야 합니다
코딩 점수가 높아도 사실을 잘못 말하거나 수행하지 않은 작업을 했다고 주장하면 실제 업무에서는 곤란합니다.
다음은 OpenAI 내부 평가, max 추론 설정의 결과입니다. 아래 두 지표는 낮을수록 좋습니다. [1]
| 모델 | 사실 오류가 포함된 응답 비율 | 코딩 기만 평가 비율 |
|---|---|---|
| GPT-5.6 Sol | 8.5% | 10.4% |
| GPT-6 Sol | 4.6% | 1.3% |
| GPT-5.6 Luna | 12.0% | 9.5% |
| GPT-6 Luna | 7.6% | 2.8% |
| GPT-6 Astra | 3.9% | 0.5% |
Sol의 사실 오류 비율은 8.5%에서 4.6%로 줄었습니다. 3.9%p 감소, 기존 비율 대비로는 약 46% 감소입니다. 코딩 기만 평가에서도 두 새 모델 모두 이전 세대보다 낮은 수치를 보였습니다.
다만 사실성 평가는 과거 사용자가 오류를 지적한 어려운 질문을 바탕으로 했고, 답변 길이를 통제하지 않았습니다. 코딩 기만 등 정렬 평가는 실패를 유도하는 내부 과제를 사용합니다.
따라서 이 비율을 일상적인 사용 중 오류 발생 확률로 해석하면 안 됩니다. [1]
공식 차트에서는 아래쪽일수록 사실 오류가 포함된 답변 비율이 낮습니다. 추론 강도와 비용이 다른 지점을 함께 보여 주므로, 오류 비율 하나만 떼어 보기보다는 조건을 같이 확인해야 합니다.

그림 3. OpenAI 공식 ‘Factual error rate on difficult prompts’ 차트. 출처: OpenAI, Introducing GPT-6 Sol and Luna (2026-09-23 확인). 과제당 비용과 사실 오류가 하나라도 포함된 답변 비율을 비교한 내부 평가입니다. 일상적인 사용의 오류 확률은 아닙니다.
개선이 모든 문제의 해결을 의미하지도 않습니다. 같은 발표의 경고 우회 내부 평가에서는 Sol 64.4%, Luna 42.4%, Astra 17.4%가 보고되었습니다. 이 역시 실패를 유도한 조건의 수치이지만, 일부 신뢰성 지표가 좋아졌다고 안전장치와 검토 절차를 없애서는 안 된다는 점은 분명합니다. [1] [14]
공개된 점수가 좋아졌다고 해서 한국어 답변 품질, 첫 응답까지의 시간, 혼잡 시간대 지연, 실제 서비스 장애율까지 함께 검증된 것은 아닙니다. 이번 글에서는 그 항목을 직접 측정하지 않았으므로 순위를 매기지 않았습니다.
특히 모델이 “테스트를 통과했다”고 말하는 것과 실제 테스트 로그가 존재하는 것은 다릅니다. 코딩 에이전트를 쓴다면 결과 설명만 보지 말고 변경 파일, 실행 명령, 테스트 결과를 함께 확인하는 과정이 필요합니다.
5. 다만, 긴 컨텍스트와 캐시에는 별도 계산이 필요합니다
105만 토큰 컨텍스트라는 숫자만 보고 긴 문서를 계속 넣으면 예상보다 청구액이 커질 수 있습니다.
공식 문서는 입력 토큰이 272,000을 초과하면 해당 요청 전체에 입력·캐시 2배, 출력 1.5배 요율을 적용한다고 설명합니다.
초과한 부분에만 할증하는 것으로 계산하면 안 됩니다. [2] [3] [4] [5] [6] [7]
예를 들어 GPT-6 Sol에 입력 300,000토큰과 과금 대상 출력 10,000토큰을 사용하는 요청은, 캐시 없이 다음과 같이 계산됩니다.
- 입력:
0.3 × $2 × 2 = $1.20 - 출력:
0.01 × $10 × 1.5 = $0.15 - 합계: $1.35
기본 단가만 적용해서 계산한 $0.70과는 차이가 있습니다.
캐시도 “저장해 두면 무조건 90% 할인”은 아닙니다. 캐시 읽기는 일반 입력의 10% 가격이지만, 캐시 쓰기는 일반 입력의 1.25배 가격입니다.
이때 쓰기 요율은 해당 토큰에 적용되는 요율이지, 일반 입력 가격에 1.25배를 다시 더하는 뜻은 아닙니다. 동일한 입력이 얼마나 재사용되는지에 따라 이득이 달라집니다. [3] [4] [5] [6] [7]
이 밖에도 처리 방식과 도구 사용 비용을 구분해야 합니다. 문서상 Batch·Flex는 Standard의 50%, Fast는 2배 요율이며, 웹 검색·파일 검색·컨테이너 등의 도구 요금과 적용 가능한 지역 처리 추가 요금은 별도입니다. 실제 견적은 토큰 단가표 한 장만으로 끝내기 어렵습니다. [2]
6. 같은 작업을 1만 번 실행하면 얼마나 차이가 날까요?
실제 금액으로 바꾸어 보겠습니다. 아래는 성능 테스트가 아니라 사용량을 고정한 계산 예시입니다.
가정은 다음과 같습니다.
- 요청 1회당 입력 10,000토큰
- 요청 1회당 과금 대상 출력 2,000토큰
- 같은 사용량으로 10,000회 실행
- Standard 처리, 캐시 미사용, 긴 입력 할증 없음
- 도구 호출·재시도·세금·환율 변환 비용 제외
출력 2,000토큰은 화면에 보이는 답변 길이가 아니라 추론 토큰 등을 포함한 과금 대상 출력 전체로 가정했습니다.
총비용 = 입력 100M × 입력 단가 + 출력 20M × 출력 단가
| 모델 | 입력 비용 | 출력 비용 | 1만 회 합계 |
|---|---|---|---|
| GPT-5.6 Sol | $400 | $400 | $800 |
| GPT-6 Sol | $200 | $200 | $400 |
| GPT-5.6 Luna | $20 | $24 | $44 |
| GPT-6 Luna | $10 | $10 | $20 |
| GPT-6 Astra | $1,000 | $1,000 | $2,000 |
같은 조건의 합계를 막대그래프로 바꾸어 보겠습니다. Luna의 막대가 짧은 것은 표시 오류가 아니라, 이 계산 조건에서 비용 차이가 크기 때문입니다.

그림 4. 입력 10,000토큰과 과금 출력 2,000토큰을 요청당 사용하고 1만 회 실행하는 경우의 비용. 자료: OpenAI API Pricing (2026-09-23 기준). 직접 계산·시각화했으며 실측 성능이 아닙니다. Standard·캐시 미사용, 도구·재시도·세금·환율 비용 제외. 막대는 0에서 시작하는 같은 선형 축을 사용했습니다.
이 조건에서는 Sol의 총비용이 50%, Luna는 약 54.5% 줄어듭니다. 앞에서 계산한 Luna 출력 단가 인하율 58.3%와 다른 이유는 입력 비용도 함께 포함했기 때문입니다.
하지만 모델마다 같은 정답을 만드는 데 필요한 토큰 수와 재시도 횟수가 다를 수 있습니다. 따라서 이 표는 “모든 작업이 이 비용으로 성공한다”는 뜻이 아닙니다.
운영에서는 성공한 작업 1건을 얻는 데 들어간 총비용을 같이 봐야 합니다. 싼 모델을 여러 번 재시도하고 상위 모델까지 다시 호출한다면, 처음부터 적절한 모델을 선택하는 편이 나을 수도 있습니다.
7. 그러면 어떤 모델을 선택하면 좋을까요?
공개 자료를 기준으로 한 제 판단은 다음과 같습니다. 특정 모델을 모든 업무의 정답으로 고르기보다는, 작업을 나누어 보는 편이 좋겠습니다.

그림 5. 본문 7절의 모델 선택 과정을 직접 도식화했습니다. OpenAI의 모델 용도 설명을 참고한 필자의 판단 흐름이며, 특정 작업의 성능이나 성공을 보장하는 규칙은 아닙니다.
1) 목표가 명확한 대량 작업: Luna부터 검증
문서 분류, 정해진 항목 추출, 짧은 요약처럼 정답 기준을 만들기 쉬운 작업이라면 GPT-6 Luna를 먼저 평가해 볼 만합니다.
다만 가격이 싸다는 이유로 검증 없이 맡기기보다는 필수 필드 누락, 형식 오류, 근거 없는 내용 추가를 검사해야 합니다. 통과한 결과만 사용하고 실패한 건은 Sol이나 사람이 다시 확인하는 방식입니다.
2) 코딩과 여러 단계의 자동화: Sol을 기본 후보로
GPT-6 Sol은 코딩과 에이전트 작업을 함께 고려할 때 기본 모델 후보로 삼기 좋아 보입니다. Astra보다 단가가 낮고, 공개 평가에서 이전 Sol보다 개선된 부분이 확인되기 때문입니다.
여기서도 실제 저장소의 수정 작업, 테스트 실행, 도구 호출 성공 여부까지 포함해서 검증해야 합니다. 벤치마크의 몇 점 차이보다 내 업무에서 반복되는 실패가 줄어드는지가 더 중요합니다.
3) 어려운 작업과 실패 비용이 큰 작업: Astra를 추가 비교
단순한 문서 추출과 복잡한 문제 해결을 같은 모델 하나로 처리할 필요는 없습니다. Sol이 계속 실패하는 작업이나, 재작업 비용이 큰 작업은 Astra를 함께 평가하는 편이 합리적입니다.
물론 비싼 모델이라고 오류가 없어지는 것은 아닙니다. 중요한 판단에는 원문·테스트·사람의 검토가 여전히 필요합니다.
4) 이미 GPT-5.6을 운영 중이라면: 바로 교체하기 전에 회귀 테스트
가격과 공개 성능만 보면 GPT-6을 검토할 이유는 충분합니다. 다만 기존 프롬프트의 응답 형식이나 도구 호출 흐름이 바뀌면, 단가 절감보다 운영 변경 비용이 더 커질 수 있습니다.
도입 전에는 대표적인 한국어 업무를 모아 기존 모델과 새 모델을 같은 조건으로 비교하는 절차를 권합니다.
- 정답률·누락률·형식 오류율을 정의합니다.
- 입력, 추론 강도, 도구 권한, 시간 제한을 가능한 한 맞춥니다.
- 성공률과 함께 과금 토큰, 재시도, 평균·상위 지연시간을 기록합니다.
- 소량부터 전환하고 문제가 생기면 이전 모델로 돌아갈 수 있게 합니다.
개발 측면에서는 API 호환 조건도 확인해야 합니다. Astra의 도구 호출에는 Responses API가 필요하며, Sol·Luna도 Chat Completions에서 함수 호출을 사용할 때 reasoning_effort: "none" 조건이 있습니다. 기존 코드를 모델 이름만 바꾸어 바로 적용하기보다 공식 마이그레이션 문서를 먼저 확인하는 편이 좋겠습니다. [8]
8. 총평: 더 강한 모델보다, 적절한 모델을 고르는 문제
이번 발표의 의미를 단순히 “새 모델이 더 똑똑해졌다”로만 정리하기는 아쉽습니다.
GPT-6 Sol·Luna는 더 낮아진 단가로 어디까지 업무를 처리할 수 있는지 다시 계산하게 만드는 모델이라고 생각합니다. Luna로 충분한 작업과 Sol이 필요한 작업을 나누고, 그보다 어려운 작업에서 Astra의 추가 비용을 평가하는 식입니다.
정리하면, 가격표에서는 토큰 단가를 보고, 벤치마크에서는 어떤 종류의 작업이 개선되었는지 보고, 최종 선택은 실제 업무에서의 성공률과 총비용으로 판단하는 것이 좋겠습니다.
숫자는 비교의 출발점이고, 실제 사용할 업무에 맞춘 검증이 마지막 단계입니다.
참고한 문서
아래 자료는 2026년 9월 23일(한국시간)에 확인했습니다. 가격과 제공 범위는 이후 변경될 수 있으므로 실제 도입 시 다시 확인하시기 바랍니다.
- OpenAI, Introducing GPT-6 Sol and Luna : 출시 발표, 용도, 공식 성능·신뢰성 평가, 제공 범위.
- OpenAI API Pricing : 처리 모드별 단가, 긴 입력 요율, 도구 사용 비용.
- GPT-6 Sol 모델 문서 : 가격, 컨텍스트, 추론 설정, 캐시·긴 입력 조건.
- GPT-6 Luna 모델 문서 : 가격과 지원 사양.
- GPT-5.6 Sol 모델 문서 : 비교 모델 사양과 프로모션 조건.
- GPT-5.6 Luna 모델 문서 : 비교 모델의 현재 가격과 사양.
- GPT-6 Astra 모델 문서 : 상위 모델의 가격과 추론·도구 지원 조건.
- OpenAI, Using GPT-6 / 최신 모델 마이그레이션 가이드 : API 변경 시 확인할 사항.
- Zapier AutomationBench : 업무 자동화 평가의 조건과 공개 리더보드.
- Cognition FrontierCode, FrontierCode 1.1 방법론 : 코딩 평가 점수와 채점 방식.
- Datacurve DeepSWE, DeepSWE 방법론 : 소프트웨어 엔지니어링 평가와 공개 결과.
- OSWorld 2.0 : 컴퓨터 사용 평가의 버전·점수 체계와 공개 결과.
- Agents’ Last Exam : 에이전트 평가의 범위와 방법론.
- OpenAI GPT-6 System Card : 안전성·정렬 평가의 조건과 한계.
