|
📬 척척 소식지
GPT-5.4는 얼마나 좋아졌을까 — 성능, 지표, 활용 사례 정리
|
|
안녕하세요, 독자님. 척척 소식지입니다.
최근 OpenAI는 GPT-5.4를 ChatGPT, API, Codex에 출시하며, 전문 업무에 더 강한 최신
프론티어 모델로 소개했습니다.
이번 뉴스레터에서는 먼저 GPT-5.4의 핵심 성능 지표와 특성을 간단히 짚고, 이어서 공식 쇼케이스와 기업
공개 자료에서 확인 가능한 활용 사례를 차례로 살펴보겠습니다.
OpenAI 공식 발표를 바탕으로, GPT-5.4의 핵심 성능 지표와 특성을 먼저 살펴보고 실제 활용
사례까지 이어서 정리했습니다.
|
|
📊 먼저 봐야 할 GPT-5.4 성능과 특성
OpenAI는 GPT-5.4를 추론, 코딩, 에이전트 워크플로우를 하나로 묶은 모델로 설명합니다. 특히 문서, 스프레드시트, 프레젠테이션
같은 실무형 결과물과 컴퓨터 사용 능력에서 강점을 강조하고 있습니다.
지식노동 성능
GDPval에서 GPT-5.4는 83.0%를 기록했습니다. OpenAI는 이를 44개 직무에 걸친 실무형 지식노동 비교 결과로 제시하며, GPT-5.2의 70.9%보다 높다고 설명합니다.
|
GDPval 비교 |
|
GPT-5.4 — 83.0%
|
|
GPT-5.2 — 70.9%
|
문서·시트·발표물 품질
OpenAI는 GPT-5.4의 스프레드시트 모델링 과제 평균 점수를 87.3%로 제시했고, 프레젠테이션 결과물은 사람 평가에서 68.0% 선호를 얻었다고 설명합니다. 보기 좋은 답변을 넘어 실제 업무 산출물의 완성도를 높이는 방향이 더 분명해졌습니다.
정확성과 사실성
OpenAI에 따르면 GPT-5.4는 GPT-5.2보다 개별 주장 단위에서 false일 가능성이 33% 낮고, 전체 응답이 오류를 포함할 가능성도 18% 낮습니다. 실무에서는 화려한 표현보다 오류를 줄이는 능력이 더 중요하다는 점에서 의미가 있습니다.
컴퓨터 사용 능력
GPT-5.4는 OpenAI가 공개한 첫 일반 목적 모델 중 네이티브 컴퓨터 사용 능력을 갖춘 모델로 소개됩니다. OSWorld-Verified에서는 75.0%를 기록해 GPT-5.2의 47.3%를 크게 웃돌았고, 사람 성능 72.4%도 넘어섰습니다.
|
OSWorld-Verified 비교 |
|
GPT-5.4 — 75.0%
|
|
인간 기준 — 72.4%
|
|
GPT-5.2 — 47.3%
|
|
|
|
💡 이어서 보는 공식 활용 사례
출시 직후 다양한 개인 테스트가 공유됐지만, 아래에서는 공식 쇼케이스와 기업 공개 자료로 확인 가능한 사례 위주로 살펴보겠습니다.
시네마틱·게임형 인터랙션
골든 게이트 브릿지를 배경으로 한 비행형 체험, 브라우저 기반 3D 도시 생성기, 테마파크 시뮬레이션 게임 같은 예시가 공개됐습니다. GPT-5.4는 단순 설명을 넘어, 사용자가 직접 조작하는 화면을 빠르게 형태로 만드는 데 쓰이고 있습니다.
커머스·랜딩 페이지 제작
상품 탐색 흐름을 담은 이커머스 예시와 커피하우스 랜딩 페이지는, 초기 기획 단계에서 화면 구조와 사용자 흐름을 빠르게 시각화하는 방향을 보여줍니다.
시각 자산과 구현의 연결
OpenAI는 쇼케이스 예시들이 Codex와 GPT-5.4로 제작됐고, 시각 자산은 GPT Image 1.5로 생성됐다고 설명합니다. 기획, 구현, 비주얼 제작이 하나의 작업 흐름으로 자연스럽게 이어지는 방식이 더 선명해졌습니다.
|
|
|
🏢 기업 적용 사례로 본 실무 활용
Mercor
Mercor는 APEX-Agents benchmark에서 GPT-5.4가 가장 높은 수준의 성능을 보였다고 평가했습니다. 에이전트형 업무 자동화에서 강점을 보여주는 사례로 볼 수 있습니다.
Harvey
Harvey는 BigLaw Bench에서 91%를 기록했다고 밝혔습니다. 법률 문서 검토와 복잡한 전문지식 기반 업무에 더 적합해졌다는 점을 보여줍니다.
Mainstay
Mainstay는 약 3만 개 포털 평가에서 첫 시도 성공률 95%, 세 번 이내 100%를 기록했고, 이전 세대 대비 더 빠르고 토큰 사용도 크게 줄었다고 설명합니다.
Box
Box는 GPT-5.4를 평가한 결과, 문서 데이터 추출 정확도와 다단계 계산·추론 성능이 이전 세대보다 개선됐다고 공개했습니다. 실제 기업 문서 처리 관점에서 참고할 만한 독립 평가입니다.
|
|
|
🧐 척척의 인사이트
이번 GPT-5.4 발표에서 눈에 띄는 부분은 “더 똑똑해졌다”보다 “실제 업무 결과물과 도구 사용에 더 강해졌다”는 점입니다. 이제
차이를 만드는 것은 코드를 얼마나 많이 아느냐보다, 원하는 결과물을 얼마나 구체적으로 정의하고 요구사항을 구조적으로 전달하느냐에 더
가까워지고 있습니다.
|
|
|
오늘 소개한 GPT-5.4의 성능과 활용 사례들 가운데, 가장 먼저 직접 써보고 싶은 기능은 무엇인가요?
스레드에서 여러분의 아이디어를 함께 나눠 주세요.
스레드에서 함께 이야기하기
|
더 나은 내일을 위해 오늘도 한 걸음씩 나아가는 여러분을 응원합니다.
© 2026 척척 소식지. All rights reserved.
수신거부
|
|