About the Role
VESSL AI의 Technical Program Manager는 Product Division 소속으로 Capacity & Infra Team에서 Supply 조직의 신규 용량 확보·온보딩 일정과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 실행 계획으로 전환합니다. SRE가 정의한 SLI/SLO 데이터를 근거로 고객에게 제시 가능한 Demand-side SLA 수준을 설계하고, SRE·Product·Sales Leadership 간의 협의를 주도해 최종 합의를 이끌어냅니다. 정기 Capacity Review를 운영하며 배분 현황과 리스크를 관련 조직과 공유합니다. 또한 팀 내 SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트를 이끌며, VESSL AI 플랫폼 전반의 안정적 운영을 책임집니다.
GPU는 유한하고 값비싼 자원입니다. 하나의 클러스터는 온디맨드·예약형(RI) 등 여러 판매 방식으로, 그리고 Training부터 Inference까지 다양한 워크로드 형태로 동시에 여러 고객에게 활용됩니다. 이 자원을 실제로 확보하는 조직(신규 클러스터 조달·구축을 담당하는 Supply 조직), 이를 운영하고 실제 가용 용량을 책임지는 조직(SRE/Infra), 그리고 이를 판매하고 고객에게 커밋하는 조직(Sales/CS) 간에는 지속적인 정보 동기화와 우선순위 정렬이 필요합니다. Capacity Plan 수립, 배분 현황 추적, 공급 지연이나 수요 급증에 따른 리스크 관리를 위해서는 이 세 조직으로부터 데이터를 취합하고 의사결정을 조율해나갑니다.
What you will do
- Capacity Plan 통합: Supply 조직의 신규 용량 확보 계획과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 지속적으로 업데이트
- 신규 Supply 온보딩 조율: Supply 조직이 확보한 신규 클러스터가 검증, 네트워크·스케줄러 연동을 거쳐 플랫폼에서 실제로 판매 가능한 상태가 되기까지의 일정을 SRE/Infra와 조율하고 추적
- Demand-side SLA 설계 및 협의 주도: SRE의 SLI/SLO 데이터를 기반으로 고객에게 제시 가능한 SLA 수준을 설계하고, SRE·Product·Sales Leadership과의 협의를 주도해 최종 합의를 이끌어냄
- Capacity Allocation Governance: 온디맨드·예약형(RI)·스팟 등 판매 유형별 용량 배분 정책을 수립하고, 실제 배분 현황을 추적·리포팅
- Infra Program 리딩: SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트 우선순위를 정하고 실행을 조율
- Program Cadence & Reporting: Capacity Review 등 정기 운영 회의체를 설계·운영하고, 팀 내 SWE와 함께 공급-수요 가시화 도구를 기획·구축하며, 경영진 및 유관 조직을 위한 대시보드·리포팅 체계를 구축
- Risk & Escalation: 공급 지연, 온보딩 지연, 수요 급증, 인프라 장애 등으로 인한 리스크를 조기에 포착해 관련 조직에 에스컬레이션하고 완화 계획을 함께 수립
Qualifications
- 컴퓨터공학, 산업공학 등 관련 전공 학사 이상 학위 보유
- TPM/Product Manager/Project Manager로서 6년 이상의 경험
- 클라우드/데이터센터/GPU 인프라의 기술적 구조(컴퓨팅, 네트워크, 스토리지)에 대한 기본적 이해
- SLI/SLO 데이터를 근거로 대고객 SLA를 설계하고, 여러 조직 간 합의를 이끌어낸 경험
- SRE, SWE, Security Engineer 등 엔지니어 직군과 직접 협업하며 기술적 우선순위를 조율해 본 경험
- 엔지니어링, 세일즈, 경영진 등 서로 다른 배경의 이해관계자 간 데이터를 취합해 의사결정을 이끌어낸 경험
- 복잡한 프로그램의 리스크와 디펜던시를 구조화하고 관리해 본 경험
- SQL 등을 활용해 데이터를 분석하고 대시보드를 구축할 수 있는 분
- 비즈니스 레벨의 영어 커뮤니케이션 역량 보유
Helpful experience (not required)
- 대규모 GPU/HPC 클러스터를 운영하는 조직 또는 CSP에서의 Capacity Planning Program의 관리 경력
- Site Reliability Engineering 프랙티스(SLO/SLA, On-call, Incident Management/Postmortem)에 대한 이해
- SOC2 등 보안/컴플라이언스 프레임워크 관련 프로젝트 참여 경험
- CSP/데이터센터와의 조달·계약 프로세스에 대한 이해
- Kubernetes, Slurm 등 스케줄링/오케스트레이션 환경에 대한 이해
- 스타트업/하이퍼그로스 환경에서 프로세스를 처음부터 설계해 본 경험
- 정해진 스코프에 갇히지 않고 다양한 조직을 넘나들며 문제를 해결하는 것에 익숙하신 분
- 애매하고 답이 정해지지 않은 문제를 스스로 구조화해서 풀어나가는 것에 익숙하신 분
Life & Benefit
함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원
- 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
- 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
- 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
- 구성원 간의 1on1 음료 지원
업무 생산성을 높여 몰입할 수 있는 환경
- 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
- 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
- 월 1회 Allhands + Team Gathering 통한 업무 공유
- 늦은 시간까지 근무 시, 야근식대/택시비 지원
- 구성원 간의 1on1 음료 지원
몰입한 만큼 휴식과 생활 편의 지원
- 개인 간식비 지원 (월 한도)
- 장기근속자 리프레시 휴가 제공
- 종합건강검진비 및 휴가 지원 (연 1회)
- 입사 N주년 축하 선물 제공
- 생일 반차 휴가 제공
- 명절 선물, 각종 휴가 및 경조금 지원
- 본인 및 배우자 출산휴가비 지원
Joinning Process
서류전형 → 과제전형 → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.
- 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
- 지원서 (경력 세부 기술) 및 포트폴리오를 필수로 제출해주세요. (양식 자유)
- Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
- 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
- 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
- 근무 형태
- 정규직 (수습 3개월)
- 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
Technical Program Manager
About the Role
VESSL AI의 Technical Program Manager는 Product Division 소속으로 Capacity & Infra Team에서 Supply 조직의 신규 용량 확보·온보딩 일정과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 실행 계획으로 전환합니다. SRE가 정의한 SLI/SLO 데이터를 근거로 고객에게 제시 가능한 Demand-side SLA 수준을 설계하고, SRE·Product·Sales Leadership 간의 협의를 주도해 최종 합의를 이끌어냅니다. 정기 Capacity Review를 운영하며 배분 현황과 리스크를 관련 조직과 공유합니다. 또한 팀 내 SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트를 이끌며, VESSL AI 플랫폼 전반의 안정적 운영을 책임집니다.
GPU는 유한하고 값비싼 자원입니다. 하나의 클러스터는 온디맨드·예약형(RI) 등 여러 판매 방식으로, 그리고 Training부터 Inference까지 다양한 워크로드 형태로 동시에 여러 고객에게 활용됩니다. 이 자원을 실제로 확보하는 조직(신규 클러스터 조달·구축을 담당하는 Supply 조직), 이를 운영하고 실제 가용 용량을 책임지는 조직(SRE/Infra), 그리고 이를 판매하고 고객에게 커밋하는 조직(Sales/CS) 간에는 지속적인 정보 동기화와 우선순위 정렬이 필요합니다. Capacity Plan 수립, 배분 현황 추적, 공급 지연이나 수요 급증에 따른 리스크 관리를 위해서는 이 세 조직으로부터 데이터를 취합하고 의사결정을 조율해나갑니다.
What you will do
- Capacity Plan 통합: Supply 조직의 신규 용량 확보 계획과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 지속적으로 업데이트
- 신규 Supply 온보딩 조율: Supply 조직이 확보한 신규 클러스터가 검증, 네트워크·스케줄러 연동을 거쳐 플랫폼에서 실제로 판매 가능한 상태가 되기까지의 일정을 SRE/Infra와 조율하고 추적
- Demand-side SLA 설계 및 협의 주도: SRE의 SLI/SLO 데이터를 기반으로 고객에게 제시 가능한 SLA 수준을 설계하고, SRE·Product·Sales Leadership과의 협의를 주도해 최종 합의를 이끌어냄
- Capacity Allocation Governance: 온디맨드·예약형(RI)·스팟 등 판매 유형별 용량 배분 정책을 수립하고, 실제 배분 현황을 추적·리포팅
- Infra Program 리딩: SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트 우선순위를 정하고 실행을 조율
- Program Cadence & Reporting: Capacity Review 등 정기 운영 회의체를 설계·운영하고, 팀 내 SWE와 함께 공급-수요 가시화 도구를 기획·구축하며, 경영진 및 유관 조직을 위한 대시보드·리포팅 체계를 구축
- Risk & Escalation: 공급 지연, 온보딩 지연, 수요 급증, 인프라 장애 등으로 인한 리스크를 조기에 포착해 관련 조직에 에스컬레이션하고 완화 계획을 함께 수립
Qualifications
- 컴퓨터공학, 산업공학 등 관련 전공 학사 이상 학위 보유
- TPM/Product Manager/Project Manager로서 6년 이상의 경험
- 클라우드/데이터센터/GPU 인프라의 기술적 구조(컴퓨팅, 네트워크, 스토리지)에 대한 기본적 이해
- SLI/SLO 데이터를 근거로 대고객 SLA를 설계하고, 여러 조직 간 합의를 이끌어낸 경험
- SRE, SWE, Security Engineer 등 엔지니어 직군과 직접 협업하며 기술적 우선순위를 조율해 본 경험
- 엔지니어링, 세일즈, 경영진 등 서로 다른 배경의 이해관계자 간 데이터를 취합해 의사결정을 이끌어낸 경험
- 복잡한 프로그램의 리스크와 디펜던시를 구조화하고 관리해 본 경험
- SQL 등을 활용해 데이터를 분석하고 대시보드를 구축할 수 있는 분
- 비즈니스 레벨의 영어 커뮤니케이션 역량 보유
Helpful experience (not required)
- 대규모 GPU/HPC 클러스터를 운영하는 조직 또는 CSP에서의 Capacity Planning Program의 관리 경력
- Site Reliability Engineering 프랙티스(SLO/SLA, On-call, Incident Management/Postmortem)에 대한 이해
- SOC2 등 보안/컴플라이언스 프레임워크 관련 프로젝트 참여 경험
- CSP/데이터센터와의 조달·계약 프로세스에 대한 이해
- Kubernetes, Slurm 등 스케줄링/오케스트레이션 환경에 대한 이해
- 스타트업/하이퍼그로스 환경에서 프로세스를 처음부터 설계해 본 경험
- 정해진 스코프에 갇히지 않고 다양한 조직을 넘나들며 문제를 해결하는 것에 익숙하신 분
- 애매하고 답이 정해지지 않은 문제를 스스로 구조화해서 풀어나가는 것에 익숙하신 분
Life & Benefit
함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원
- 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
- 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
- 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
- 구성원 간의 1on1 음료 지원
업무 생산성을 높여 몰입할 수 있는 환경
- 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
- 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
- 월 1회 Allhands + Team Gathering 통한 업무 공유
- 늦은 시간까지 근무 시, 야근식대/택시비 지원
- 구성원 간의 1on1 음료 지원
몰입한 만큼 휴식과 생활 편의 지원
- 개인 간식비 지원 (월 한도)
- 장기근속자 리프레시 휴가 제공
- 종합건강검진비 및 휴가 지원 (연 1회)
- 입사 N주년 축하 선물 제공
- 생일 반차 휴가 제공
- 명절 선물, 각종 휴가 및 경조금 지원
- 본인 및 배우자 출산휴가비 지원
Joinning Process
서류전형 → 과제전형 → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.
- 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
- 지원서 (경력 세부 기술) 및 포트폴리오를 필수로 제출해주세요. (양식 자유)
- Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
- 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
- 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
- 근무 형태
- 정규직 (수습 3개월)
- 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
- 근무지서울 강남구 테헤란로5길 7 13층