
OpenAI WebSocket Mode for Responses API
OpenAI · 코딩
Responses API용 OpenAI WebSocket 모드는 반복적인 HTTP 요청 대신 하나의 WebSocket으로 길고 도구를 많이 쓰는 에이전트 워크플로를 실행하는 상시 연결 모드다. Responses 엔드포인트에 연결을 하나 열고, 각 턴에서는 새 입력 항목과 previous_response_id만 보내 가볍게 유지한다. 같은 작업이 수십 번 도구를 호출하는 에이전트형 코딩과 오케스트레이션 루프를 위해 만들어졌으며, store=false와 함께 쓰면 프라이버시에 민감한 환경에서도 동작한다.

OpenAI WebSocket Mode for Responses API 소개
Responses API용 OpenAI WebSocket 모드란 무엇인가
OpenAI WebSocket 모드는 Responses API의 전송 옵션이지 별도 제품이 아니다. Responses API는 에이전트 스타일 앱을 만들기 위한 OpenAI의 상태 유지형 기본 요소이며, 대부분의 신규 프로젝트가 시작하는 엔드포인트다. 바뀌는 것은 그 아래의 파이프다. 그게 전부다. 프롬프트와 도구에 관한 나머지는 모두 그대로다.
이것이 해결하는 문제는 이어가기의 오버헤드다. 표준 HTTP 모드에서는 매 턴마다 연결을 다시 열고, 계속 커지는 컨텍스트를 매번 다시 보낸다. 단발 질문에는 문제없다. 도구를 스무 번, 서른 번 연달아 호출하는 에이전트에게는 그 왕복이 모두 쌓인다. WebSocket 모드는 Responses 엔드포인트로 가는 연결을 열어 두고, 각 후속 턴이 차이분만 보내도록 한다. previous_response_id로 이어 붙인다. 대단한 기술이 아니다. 더 나은 파이프일 뿐이다.
가장 큰 제약은 적용 범위다. 이 모드는 길고 도구를 많이 쓰는 워크플로를 위한 것이지, 모든 경우를 위한 것이 아니다. OpenAI 자체 지침도 단발 요청과 짧은 대화는 표준 HTTP Responses API에 남겨 두라고 한다. 거기서는 최적화 효과가 작기 때문이다. 연결에는 시간 제한도 있어, 긴 실행에서는 재연결을 처리해야 한다. 조금 번거롭지만 감당할 만하다.
시작하기
- OpenAI API 키를 발급받고, Python이라면 websocket-client 패키지 같은 WebSocket 클라이언트를 설치한다.
- Responses WebSocket 엔드포인트로 소켓을 열고 Authorization 헤더에 키를 전달한다.
- response.create 이벤트로 첫 턴을 보낸다. 모델, 도구, 최초 입력을 포함한다.
- 대화를 이어가려면 이전 턴의 previous_response_id를 참조하고 function_call_output 같은 새 입력 항목만 담은 새 response.create를 보낸다.
- 서버 이벤트가 스트림으로 돌아오는 것을 읽고, 연결 시간 제한에 닿으면 소켓을 닫거나 다시 연결한다.
제품 정보
OpenAI WebSocket Mode for Responses API의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- 저지연 도구 루프가 필요한 에이전트를 만드는 백엔드 및 AI 엔지니어. 이 모드는 서버 간 트래픽을 겨냥한다.
- 같은 작업이 배포 한 번에 도구를 수십 번 호출하는 오케스트레이션 부하를 돌리는 플랫폼 팀.
- store=false와 데이터 무보존을 지원하는 전송이 필요한, 프라이버시 제약이 있는 개발자.
작업
- 에이전트형 코딩
- 도구 호출 처리
- 멀티턴 오케스트레이션
활용 상황
- 파일 분석, 패치 생성, 테스트 실행을 살아 있는 소켓 위에서 반복하는 코딩 에이전트.
- 턴당 지연이 중요한 상황에서 사용자 요청마다 여러 도구 호출을 조율하는 백엔드 서비스.
- 모델과 프롬프트를 바꾸지 않고 대량 에이전트 트래픽의 오버헤드를 줄이려는 팀.
주요 기능
Responses 엔드포인트로의 상시 연결
WebSocket 모드는 여러 턴에 걸쳐 Responses API로 가는 연결 하나를 열어 둔다. response.create 이벤트로 조작하며, 첫 이벤트는 일반 요청처럼 새 턴을 시작한다. 소켓이 열려 있으니 표준 스트리밍 API가 매 턴 치르는 연결 설정을 건너뛴다. 그 오버헤드는 한 번이면 작다. 긴 에이전트 실행에서는 그렇지 않다.
previous_response_id를 통한 증분 입력
후속 턴은 새 입력 항목과 이전 턴으로 이어지는 previous_response_id만 보낸다. 컨텍스트 전체를 다시 보내지 않으며, 긴 사슬에서 절감의 대부분이 여기서 나온다. 첫 턴의 페이로드는 표준 create 본문을 그대로 따르되, 여기서는 적용되지 않는 stream, background 같은 전송 전용 필드는 뺀다. 그래서 대화가 길어져도 요청은 가볍게 유지된다.
도구를 많이 쓰는 워크플로의 빠른 이어가기
핵심 이점은 워크플로가 모델과 도구의 왕복을 많이 포함할 때 나타난다. 그것이 저지연 에이전트 워크플로의 세계이며, 이 전송은 그들을 위해 만들어졌다. OpenAI 지침은 도구 호출이 많은 배포에서 상당한 속도 향상을 가리키며, 이득은 첫 토큰만이 아니라 이어가기 경로에서 나온다. 에이전트가 같은 도구를 계속 맴돌 때 시간을 가장 많이 낭비하는 부분이 바로 거기다. 모든 워크플로가 체감하지는 않는다. 에이전트가 도구를 거의 호출하지 않으면 별로 느끼지 못한다. 끊임없이 호출한다면, 그게 바로 핵심이다.
store=false와 데이터 무보존 지원
WebSocket 모드는 store=false와 데이터 무보존 구성에서 동작한다. OpenAI가 응답 상태를 보관하게 둘 수 없을 때 중요하다. 서버는 연결이 살아 있는 동안 최근 응답 상태를 메모리에 둔다. 그래서 턴을 요청 간에 저장하지 않고도 빠른 이어가기를 얻는다. 그렇게 하지 않으면 데이터가 서버에 남는다. 규제 환경이나 프라이버시에 민감한 팀에게 이 조합은 이 전송을 택하는 이유다.
스트리밍 이벤트와 순서가 HTTP 모델과 일치
서버 이벤트와 그 순서는 기존 Responses 스트리밍 모델과 일치한다. HTTP로 스트리밍 이벤트를 이미 다루고 있다면 이벤트 형태가 익숙할 테니, 클라이언트 로직을 처음부터 다시 쓰지 않아도 된다. 차이는 전달 채널이지 메시지 형식이 아니다. 그런데 왜 옮기는가. 효과가 큰 경우의 속도 때문이다. 그래서 마이그레이션 비용이 낮게 유지된다.
장단점
장점
- 도구 호출이 많은 워크플로에서 이어가기 지연이 낮아진다. HTTP 모드가 가장 힘든 지점이 바로 거기다.
- 증분 입력만 보내므로 반복 전송과 연결 설정 오버헤드가 줄어든다.
- store=false와 데이터 무보존을 지원해 프라이버시에 민감한 팀도 쓸 수 있다.
- 서버 이벤트와 순서가 HTTP 스트리밍 모델과 일치해 기존 클라이언트 코드를 살리기 쉽다.
- 열어 둔 소켓 하나는 쌓아 올린 HTTP 요청보다 에이전트형 코딩과 오케스트레이션 루프에 더 잘 맞는다.
단점
- 길고 도구를 많이 쓰는 워크플로에만 값어치가 있다. 짧은 대화와 단발 호출은 이득이 작다.
- 연결에 시간 제한이 있어 오래 실행되는 에이전트에는 재연결 로직을 만들어야 한다.
- 이 전송은 단순한 HTTP 호출보다 관리할 코드가 많아 클라이언트 복잡도가 올라간다.
- 표준 API 사용 요금은 그대로 낸다. 이 모드가 줄이는 것은 지연이지 토큰당 비용이 아니다.
자주 묻는 질문
매 턴 새 HTTP 요청을 보내는 대신 Responses API로 가는 상시 WebSocket 연결을 유지하는 전송 모드다. 새 입력 항목과 previous_response_id만 보내므로 긴 에이전트 실행에서 턴당 오버헤드를 줄인다. 전화를 끊고 다시 거는 대신 회선에 계속 붙어 있는 셈이다.
관련 콘텐츠
OpenAI WebSocket Mode for Responses API와 관련된 도구, 스킬, 아티클을 살펴보세요.
OpenAI WebSocket Mode for Responses API 대안
Forefront
Forefront · 코딩Forefront는 오픈소스 AI로 무언가를 만드는 웹 플랫폼이다. 대표적인 오픈소스 언어 모델을 자신의 데이터로 미세 조정하고, 성능을 평가하고, API로 실행하거나 내보내 직접 호스팅할 수 있다. 폐쇄형 플랫폼의 편의를 원하면서도 모델과 데이터의 소유권은 놓지 않으려는 개발자가 대상이다.
Startkit
StartKit.AI · 코딩Startkit은 AI SaaS와 AI 래퍼 제품을 만들기 위한 보일러플레이트다. 지루한 부분을 미리 연결해 둔 AI 스타트업 보일러플레이트라고 생각하면 된다. 인증, Stripe와 Lemon Squeezy 결제, 사용량 제한, 트랜잭션 이메일, 그리고 OpenAI, Anthropic, Groq, Llama와 통신하는 AI API 스타터 키트가 포함된다. 저장소를 복제하고 가격을 정한 뒤 사용자가 실제로 돈을 내는 부분에 착수하면 된다. React와 Tailwind 위의 Next.js로 만들어졌기 때문에 보일러플레이트 코드의 상당 부분이 이미 익숙하게 느껴진다.
Testim
Tricentis · 코딩Testim은 웹, 모바일, Salesforce 애플리케이션 전반에 걸쳐 엔드투엔드 테스트를 만들고 실행하는 AI 기반 테스트 자동화 플랫폼이다. 머신러닝에 기대어 인터페이스가 바뀌어도 테스트를 안정적으로 유지하므로, 팀은 깨진 셀렉터를 고치는 데 쓰는 시간을 줄인다. 오늘부터 쓸 수 있는 자동화 테스트 도구치고 나쁘지 않다. 브라우저에서 동작을 녹화해 테스트를 만들고, 더 세밀한 제어가 필요하면 JavaScript를 더한다. 바쁜 QA 팀에게 탄탄한 선택이다.
