기술

기술 기록

이번 주 AI 소식 — 할라피뇨 와트당 성능 1.5~1.9배, o3 챗GPT 은퇴, GLM-5.3-플래시 할인가 기준 작업당 0.045달러

8월 23일부터 29일까지의 AI 소식을 모았어요. 오픈AI가 자체 추론 칩 할라피뇨의 첫 실측치를 공개했고, o3가 챗GPT에서 내려갔고, Z.ai가 GLM-5.3-플래시를 내놨어요.

어두운 배경에 이번 주 AI 소식(8월 23일~29일)과 할라피뇨 실측치·o3 은퇴·GLM-5.3-플래시가 적힌 King's Lab 주간 종합 타이틀 카드

이번 주(8월 23일~8월 29일)에는 오픈AI가 자체 설계한 첫 추론 칩의 숫자를 처음으로 내놨고, 챗GPT에서 o3가 내려갔고, Z.ai가 값싼 멀티모달 모델을 열었어요. 세 건 모두 공식 페이지에서 확인한 내용만 담았어요. 지난주 정리도 같이 보시면 흐름이 이어져요.

오픈AI가 자체 추론 칩 할라피뇨의 첫 실측치를 8월 25일에 공개했어요

측정에는 GPT-OSS 120B, 딥시크 R1 670B, 키미 K2.5 1T 세 모델을 썼어요. 최고 처리량 구간에서 같은 전력으로 처리한 AI 작업량이 1.5~1.9배였고, 요청 하나가 끝나는 데 걸리는 시간은 1.7~3.6배 짧았어요.

대화처럼 응답이 계속 오가는 작업에서는 차이가 더 벌어져서 2.1~4.1배로 나왔어요. 비교 기준은 세미애널리시스가 공개한 InferenceX 벤치마크예요.

전력 쪽 숫자도 같이 나왔어요. 할라피뇨는 정격 700와트인데 실제로 계속 돌렸을 때 소비 전력은 550와트 이하로 유지됐다고 적혀 있어요.

할라피뇨는 설계부터 테이프아웃까지 9개월이 걸렸어요

오픈AI는 자기네 모델을 설계 과정에 붙여서 이 기간을 줄였다고 밝혔어요. 코덱스와 GPT-Astra를 써서, 원래 생산 계획에 없던 오픈웨이트 모델 세 종을 두 달 만에 높은 성능까지 끌어올렸다고 해요.

눈에 띄는 건 커널 쪽이에요. GPT-OSS의 어텐션과 MoE 블록 가운데 골라낸 일부에서는 AI가 만든 구현이 사람 전문가가 직접 짠 것보다 1.5~1.8배 빨랐어요. 모델 전체가 아니라 선별한 블록에 한정된 결과라고 못 박아 뒀어요.

실제 배치는 올해 안에 오픈AI 자체 컴퓨트 인프라에서 시작해요. 다만 오픈AI는 엔비디아를 비롯한 파트너 가속기도 계속 폭넓게 쓴다고 같은 글에 적었어요.

오픈AI o3가 8월 26일에 챗GPT에서 내려갔어요

90일 유예 기간을 두고 예고했던 일정 그대로예요. 유료 사용자만 모델 설정에서 꺼내 쓸 수 있던 모델이었고, 같은 방식으로 GPT-4.5는 30일 유예 뒤 6월 26일에 먼저 내려갔어요.

이번 조치는 챗GPT에만 해당돼요. 공식 안내문에도 API 쪽에는 변경이 없다고 분명히 적혀 있어요.

API 쪽 o3 스냅샷은 12월 11일까지 쓸 수 있어요

API 은퇴 일정은 따로 굴러가요. 6월 11일에 공지가 나갔고 o3-2025-04-16o3-pro-2025-06-10은 12월 11일에 내려가요. 권장 대체 모델은 gpt-5.6-sol이에요.

오픈AI는 일반 공개 모델에는 최소 6개월, 코덱스 같은 특수 변형에는 최소 3개월, 프리뷰 모델에는 2주 수준까지 짧아질 수 있는 예고 기간을 둔다고 같은 문서에 정리해 놨어요.

Z.ai가 GLM-5.3-플래시를 이번 주 공개하며 할인가 기준 작업당 0.045달러를 제시했어요

Artificial Analysis 지능 지수 v4.1.1에서 57점을 받았고, 할인가 기준 작업당 비용이 0.045달러라고 밝혔어요. 총 파라미터는 3200억 개인데 실제로 켜지는 건 180억 개고, 컨텍스트는 100만 토큰까지 받아요.

구조를 바꿔서 비용을 깎았어요. 희소 어텐션과 선형 어텐션을 섞은 덕에 GLM-5.3 대비 어텐션 연산은 3.0배, KV 캐시는 4.4배 줄었다고 해요.

GLM 코딩 플랜은 주말과 비혼잡 시간대에 포인트를 절반만 써요

쿼터는 GLM-5.3 때보다 3배로 늘었고, 사용량은 포인트 방식으로 계산해요. 비혼잡 시간대 호출은 포인트를 50%만 차감하는데 주말은 하루 종일 여기에 들어가요.

배치 작업을 주말로 미룰 수 있는 쪽이라면 포인트 소모가 절반이라 같은 쿼터로 더 많은 호출을 처리할 수 있어요.

출처

  1. Jalapeño: first results — OpenAI — GPT-OSS 120B·딥시크 R1 670B·키미 K2.5 1T 세 모델 기준 최고 처리량 구간 와트당 AI 작업량 1.5~1.9배, 종단 지연 1.7~3.6배 단축, 고대화형 작업 2.1~4.1배, 비교 기준 SemiAnalysis 공개 벤치마크 InferenceX, 정격 700W·실측 지속 소비전력 550W 이하, 선별한 GPT-OSS 어텐션·MoE 블록에서 AI 생성 구현이 사람 전문가 대비 1.5~1.8배 빠름, 코덱스와 GPT-Astra로 미계획 오픈웨이트 3종을 2개월 내 고성능 도달, 연내 자체 컴퓨트 인프라 배치 시작 및 엔비디아 등 파트너 가속기 병행을 확인, 확인일: 2026-08-29
  2. OpenAI and Broadcom unveil LLM-optimized inference chip — OpenAI — 설계부터 제조 테이프아웃까지 9개월, 브로드컴의 실리콘 구현·네트워킹과 셀레스티카의 보드·랙 통합, 2026년 말 초기 배치 후 다세대 확장을 확인, 확인일: 2026-08-29
  3. ChatGPT — Release Notes — OpenAI Help Center — OpenAI o3는 90일 유예 뒤 2026년 8월 26일 챗GPT에서 은퇴, GPT-4.5는 30일 유예 뒤 2026년 6월 26일 은퇴, 두 모델 모두 유료 사용자에게 모델 설정으로만 제공됐고 이번 변경은 챗GPT에만 적용되며 API 변경은 없음을 확인, 확인일: 2026-08-29
  4. Deprecations — OpenAI API — 2026년 6월 11일 공지로 o3-2025-04-16o3-pro-2025-06-10이 2026년 12월 11일 API에서 제거되고 권장 대체가 gpt-5.6-sol이라는 점, 일반 공개 모델 최소 6개월·특수 변형 최소 3개월·프리뷰 모델 2주 수준의 사전 고지 기준을 확인, 확인일: 2026-08-29
  5. GLM-5.3-Flash Overview — Z.AI Developer Document — 총 3200억·활성 180억 파라미터, 100만 토큰 컨텍스트, Artificial Analysis Intelligence Index v4.1.1 57점과 할인가 기준 작업당 0.045달러, GLM-5.3 대비 어텐션 연산 3.0배·KV 캐시 4.4배 절감, GLM 코딩 플랜 3배 쿼터와 주말 종일 포함 비혼잡 시간대 포인트 50% 차감을 확인, 확인일: 2026-08-29

수치는 각 회사가 자사 페이지에 올린 자체 측정값이라 제3자 재현 결과는 아직 없어요. 할라피뇨의 메모리 용량·대역폭 같은 패키지 사양은 공식 페이지 두 곳 어디에도 적혀 있지 않아 이 글에 넣지 않았어요. 대표 이미지는 King's Lab에서 자체 제작한 타이틀 카드입니다.