GPT-6 아스트라, 헬스벤치 종합 58.3점 기록
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 오픈AI 공식 시스템 카드에 GPT-6 아스트라의 헬스벤치 평가 점수와 정신건강 다중 대화 평가가 공개됐다.
- 별도 보도에서 제시된 ‘정신건강벤치’ 57.3점은 공식 평가명·결과와 구분해야 한다.
- GPT-6 아스트라(Astra)가 건강 관련 인공지능 평가인 헬스벤치(HealthBench) 종합 평가에서 58.3점을 기록했다.
본문
오픈AI 공식 시스템 카드에 GPT-6 아스트라의 헬스벤치 평가 점수와 정신건강 다중 대화 평가가 공개됐다. 별도 보도에서 제시된 ‘정신건강벤치’ 57.3점은 공식 평가명·결과와 구분해야 한다. GPT-6 아스트라(Astra)가 건강 관련 인공지능 평가인 헬스벤치(HealthBench) 종합 평가에서 58.3점을 기록했다. 별도 보도에서 제시된 ‘정신건강벤치’ 57.3점은 오픈AI의 공식 평가 결과와 구분해야 한다. 오픈AI는 공식 GPT-6 아스트라 시스템 카드에서 헬스벤치 프로페셔널 64.7점, 헬스벤치 하드 36.6점, 헬스벤치 컨센서스 95.5점을 함께 공개했다. Crypto Briefing은 23일 오픈AI가 80명 이상의 정신건강 전문가와 22개국 참여를 바탕으로 ‘정신건강벤치’를 개발했으며, GPT-6 아스트라가 57.3점을 받았다고 보도했다.
오픈AI는 헬스벤치 프로페셔널 점수가 GPT-5.6 솔보다 4.2포인트 높았고, 헬스벤치 전체 점수는 1.3포인트, 헬스벤치 하드는 3.5포인트 개선됐다고 설명했다.
따라서 헬스벤치 종합 58.3점과 정신건강벤치 57.3점을 단순 비교할 수 없다. 안전 정책을 위반하지 않은 응답의 비율을 ‘safe’ 지표로 집계했으며, 오픈AI는 GPT-6 아스트라가 GPT-5.6 솔보다 세 영역에서 개선됐다고 설명했다. 반면 58%는 아동의 정신건강 상담에 AI 챗봇이 사용되는 것을 우려했다. 오픈AI는 이 모델이 컴퓨터 사용, 소프트웨어 엔지니어링, 과학, 사이버보안 등에서 성능을 높였다고 설명했으며, GPT-6 아스트라의 단계적 유료 서비스·개발자 API 제공 도 진행했다. ‘정신건강벤치 57.3점’은 별도 평가의 방법론과 원자료가 공개되기 전까지 오픈AI 공식 결과로 단정할 수 없다.