About the Role
VESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다. Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.
그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다. GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다. 이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.
What you will do
- Reliability & Observability: 메트릭·로그·트레이스 등 Observability 스택을 구축하고, SLI/SLO를 정의해 플랫폼의 안정성을 정량적으로 추적
- Incident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결
- Architecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도
- Automation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영
- Proactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도
- Capacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드
- 팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링
Qualifications
- 컴퓨터공학, 전자공학, AI 등 관련 전공 학사 이상 학위 혹은 이에 준하는 실무 경험
- 5년 이상의 Software/Site Reliability Engineering 경험
- GPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험
- Linux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험
- Python, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험
- Kubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험
- 대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험
- 여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험
- On-call 로테이션에 참여 가능하신 분
Helpful experience (not required)
- InfiniBand/RoCEv2 등 고성능 네트워크 기반 멀티노드 클러스터 환경 운영 경험
- GPU, NVLink, InfiniBand 등 하드웨어·드라이버 레벨 이슈를 직접 디버깅해 본 경험
- Slurm, Kubernetes 기반 GPU 스케줄링 환경을 대규모로 설계·운영해 본 경험
- 대규모 서비스의 장애 대응을 리드하고 Postmortem을 작성해 본 경험
- 여러 해에 걸쳐 핵심 프로덕션 시스템을 지속적으로 소유하고 발전시켜 본 경험
- 주니어 엔지니어를 멘토링하고 팀의 기술 표준을 정립해 본 경험
- perf, eBPF, strace, kernel crash dump 등 저수준 Linux 디버깅 도구 활용 경험
- WEKA / VAST / Ceph / Hammerspace 등 고성능 병렬 스토리지 구축/운영 경험
- DiRT, Chaos Engineering 등 선제적 안정성 확보 프랙티스를 설계·운영해 본 경험
Life & Benefit
함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원
- 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
- 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
- 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
- 구성원 간의 1on1 음료 지원
업무 생산성을 높여 몰입할 수 있는 환경
- 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
- 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
- 월 1회 Allhands + Team Gathering 통한 업무 공유
- 늦은 시간까지 근무 시, 야근식대/택시비 지원
- 구성원 간의 1on1 음료 지원
몰입한 만큼 휴식과 생활 편의 지원
- 개인 간식비 지원 (월 한도)
- 장기근속자 리프레시 휴가 제공
- 종합건강검진비 및 휴가 지원 (연 1회)
- 입사 N주년 축하 선물 제공
- 생일 반차 휴가 제공
- 명절 선물, 각종 휴가 및 경조금 지원
- 본인 및 배우자 출산휴가비 지원
Joinning Process
서류전형 → Coding Test → Technical Interview → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.
- 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
- 지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)
- Technical Interview는 개발 실무자가 참여하며, 구조 설계 및 구현 방식 등 기술 중심의 대화로 문제 해결 역량을 파악하는 시간으로 최대 2시간 정도 소요됩니다.
- Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
- 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
- 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
- 근무 형태
- 정규직 (수습 3개월)
- 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
Site Reliability Engineer (Senior)
About the Role
VESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다. Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.
그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다. GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다. 이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.
What you will do
- Reliability & Observability: 메트릭·로그·트레이스 등 Observability 스택을 구축하고, SLI/SLO를 정의해 플랫폼의 안정성을 정량적으로 추적
- Incident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결
- Architecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도
- Automation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영
- Proactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도
- Capacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드
- 팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링
Qualifications
- 컴퓨터공학, 전자공학, AI 등 관련 전공 학사 이상 학위 혹은 이에 준하는 실무 경험
- 5년 이상의 Software/Site Reliability Engineering 경험
- GPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험
- Linux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험
- Python, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험
- Kubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험
- 대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험
- 여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험
- On-call 로테이션에 참여 가능하신 분
Helpful experience (not required)
- InfiniBand/RoCEv2 등 고성능 네트워크 기반 멀티노드 클러스터 환경 운영 경험
- GPU, NVLink, InfiniBand 등 하드웨어·드라이버 레벨 이슈를 직접 디버깅해 본 경험
- Slurm, Kubernetes 기반 GPU 스케줄링 환경을 대규모로 설계·운영해 본 경험
- 대규모 서비스의 장애 대응을 리드하고 Postmortem을 작성해 본 경험
- 여러 해에 걸쳐 핵심 프로덕션 시스템을 지속적으로 소유하고 발전시켜 본 경험
- 주니어 엔지니어를 멘토링하고 팀의 기술 표준을 정립해 본 경험
- perf, eBPF, strace, kernel crash dump 등 저수준 Linux 디버깅 도구 활용 경험
- WEKA / VAST / Ceph / Hammerspace 등 고성능 병렬 스토리지 구축/운영 경험
- DiRT, Chaos Engineering 등 선제적 안정성 확보 프랙티스를 설계·운영해 본 경험
Life & Benefit
함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원
- 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
- 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
- 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
- 구성원 간의 1on1 음료 지원
업무 생산성을 높여 몰입할 수 있는 환경
- 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
- 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
- 월 1회 Allhands + Team Gathering 통한 업무 공유
- 늦은 시간까지 근무 시, 야근식대/택시비 지원
- 구성원 간의 1on1 음료 지원
몰입한 만큼 휴식과 생활 편의 지원
- 개인 간식비 지원 (월 한도)
- 장기근속자 리프레시 휴가 제공
- 종합건강검진비 및 휴가 지원 (연 1회)
- 입사 N주년 축하 선물 제공
- 생일 반차 휴가 제공
- 명절 선물, 각종 휴가 및 경조금 지원
- 본인 및 배우자 출산휴가비 지원
Joinning Process
서류전형 → Coding Test → Technical Interview → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.
- 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
- 지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)
- Technical Interview는 개발 실무자가 참여하며, 구조 설계 및 구현 방식 등 기술 중심의 대화로 문제 해결 역량을 파악하는 시간으로 최대 2시간 정도 소요됩니다.
- Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
- 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
- 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
- 근무 형태
- 정규직 (수습 3개월)
- 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
- 근무지서울 강남구 테헤란로5길 7 13층