brandLogo
Technical Program Manager
상시 채용

About the Role


VESSL AI의 Technical Program Manager는 Product Division 소속으로 Capacity & Infra Team에서 Supply 조직의 신규 용량 확보·온보딩 일정과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 실행 계획으로 전환합니다. SRE가 정의한 SLI/SLO 데이터를 근거로 고객에게 제시 가능한 Demand-side SLA 수준을 설계하고, SRE·Product·Sales Leadership 간의 협의를 주도해 최종 합의를 이끌어냅니다. 정기 Capacity Review를 운영하며 배분 현황과 리스크를 관련 조직과 공유합니다. 또한 팀 내 SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트를 이끌며, VESSL AI 플랫폼 전반의 안정적 운영을 책임집니다.


GPU는 유한하고 값비싼 자원입니다. 하나의 클러스터는 온디맨드·예약형(RI) 등 여러 판매 방식으로, 그리고 Training부터 Inference까지 다양한 워크로드 형태로 동시에 여러 고객에게 활용됩니다. 이 자원을 실제로 확보하는 조직(신규 클러스터 조달·구축을 담당하는 Supply 조직), 이를 운영하고 실제 가용 용량을 책임지는 조직(SRE/Infra), 그리고 이를 판매하고 고객에게 커밋하는 조직(Sales/CS) 간에는 지속적인 정보 동기화와 우선순위 정렬이 필요합니다. Capacity Plan 수립, 배분 현황 추적, 공급 지연이나 수요 급증에 따른 리스크 관리를 위해서는 이 세 조직으로부터 데이터를 취합하고 의사결정을 조율해나갑니다.

What you will do


  1. Capacity Plan 통합: Supply 조직의 신규 용량 확보 계획과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 지속적으로 업데이트
  2. 신규 Supply 온보딩 조율: Supply 조직이 확보한 신규 클러스터가 검증, 네트워크·스케줄러 연동을 거쳐 플랫폼에서 실제로 판매 가능한 상태가 되기까지의 일정을 SRE/Infra와 조율하고 추적
  3. Demand-side SLA 설계 및 협의 주도: SRE의 SLI/SLO 데이터를 기반으로 고객에게 제시 가능한 SLA 수준을 설계하고, SRE·Product·Sales Leadership과의 협의를 주도해 최종 합의를 이끌어냄
  4. Capacity Allocation Governance: 온디맨드·예약형(RI)·스팟 등 판매 유형별 용량 배분 정책을 수립하고, 실제 배분 현황을 추적·리포팅
  5. Infra Program 리딩: SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트 우선순위를 정하고 실행을 조율
  6. Program Cadence & Reporting: Capacity Review 등 정기 운영 회의체를 설계·운영하고, 팀 내 SWE와 함께 공급-수요 가시화 도구를 기획·구축하며, 경영진 및 유관 조직을 위한 대시보드·리포팅 체계를 구축
  7. Risk & Escalation: 공급 지연, 온보딩 지연, 수요 급증, 인프라 장애 등으로 인한 리스크를 조기에 포착해 관련 조직에 에스컬레이션하고 완화 계획을 함께 수립


Qualifications


  1. 컴퓨터공학, 산업공학 등 관련 전공 학사 이상 학위 보유
  2. TPM/Product Manager/Project Manager로서 6년 이상의 경험
  3. 클라우드/데이터센터/GPU 인프라의 기술적 구조(컴퓨팅, 네트워크, 스토리지)에 대한 기본적 이해
  4. SLI/SLO 데이터를 근거로 대고객 SLA를 설계하고, 여러 조직 간 합의를 이끌어낸 경험
  5. SRE, SWE, Security Engineer 등 엔지니어 직군과 직접 협업하며 기술적 우선순위를 조율해 본 경험
  6. 엔지니어링, 세일즈, 경영진 등 서로 다른 배경의 이해관계자 간 데이터를 취합해 의사결정을 이끌어낸 경험
  7. 복잡한 프로그램의 리스크와 디펜던시를 구조화하고 관리해 본 경험
  8. SQL 등을 활용해 데이터를 분석하고 대시보드를 구축할 수 있는 분
  9. 비즈니스 레벨의 영어 커뮤니케이션 역량 보유

Helpful experience (not required)


  1. 대규모 GPU/HPC 클러스터를 운영하는 조직 또는 CSP에서의 Capacity Planning Program의 관리 경력
  2. Site Reliability Engineering 프랙티스(SLO/SLA, On-call, Incident Management/Postmortem)에 대한 이해
  3. SOC2 등 보안/컴플라이언스 프레임워크 관련 프로젝트 참여 경험
  4. CSP/데이터센터와의 조달·계약 프로세스에 대한 이해
  5. Kubernetes, Slurm 등 스케줄링/오케스트레이션 환경에 대한 이해
  6. 스타트업/하이퍼그로스 환경에서 프로세스를 처음부터 설계해 본 경험
  7. 정해진 스코프에 갇히지 않고 다양한 조직을 넘나들며 문제를 해결하는 것에 익숙하신 분
  8. 애매하고 답이 정해지지 않은 문제를 스스로 구조화해서 풀어나가는 것에 익숙하신 분

Life & Benefit


함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원

  1. 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
  2. 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
  3. 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
  4. 구성원 간의 1on1 음료 지원


업무 생산성을 높여 몰입할 수 있는 환경

  1. 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
  2. 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
  3. 월 1회 Allhands + Team Gathering 통한 업무 공유
  4. 늦은 시간까지 근무 시, 야근식대/택시비 지원
  5. 구성원 간의 1on1 음료 지원


몰입한 만큼 휴식과 생활 편의 지원

  1. 개인 간식비 지원 (월 한도)
  2. 장기근속자 리프레시 휴가 제공
  3. 종합건강검진비 및 휴가 지원 (연 1회)
  4. 입사 N주년 축하 선물 제공
  5. 생일 반차 휴가 제공
  6. 명절 선물, 각종 휴가 및 경조금 지원
  7. 본인 및 배우자 출산휴가비 지원



Joinning Process


서류전형 → 과제전형 → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.
  1. 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
  2. 지원서 (경력 세부 기술) 및 포트폴리오를 필수로 제출해주세요. (양식 자유)
  3. Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
  4. 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
  5. 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
  6. 근무 형태
  7. 정규직 (수습 3개월)
  8. 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
직군 / 직무개발 / 프로덕트 매니저
경력 사항경력 (6년 이상)
고용 형태정규직
근무지

Technical Program Manager

개발
프로덕트 매니저
경력 (6년 이상)
정규직
상시 채용
  • About the Role


    VESSL AI의 Technical Program Manager는 Product Division 소속으로 Capacity & Infra Team에서 Supply 조직의 신규 용량 확보·온보딩 일정과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 실행 계획으로 전환합니다. SRE가 정의한 SLI/SLO 데이터를 근거로 고객에게 제시 가능한 Demand-side SLA 수준을 설계하고, SRE·Product·Sales Leadership 간의 협의를 주도해 최종 합의를 이끌어냅니다. 정기 Capacity Review를 운영하며 배분 현황과 리스크를 관련 조직과 공유합니다. 또한 팀 내 SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트를 이끌며, VESSL AI 플랫폼 전반의 안정적 운영을 책임집니다.


    GPU는 유한하고 값비싼 자원입니다. 하나의 클러스터는 온디맨드·예약형(RI) 등 여러 판매 방식으로, 그리고 Training부터 Inference까지 다양한 워크로드 형태로 동시에 여러 고객에게 활용됩니다. 이 자원을 실제로 확보하는 조직(신규 클러스터 조달·구축을 담당하는 Supply 조직), 이를 운영하고 실제 가용 용량을 책임지는 조직(SRE/Infra), 그리고 이를 판매하고 고객에게 커밋하는 조직(Sales/CS) 간에는 지속적인 정보 동기화와 우선순위 정렬이 필요합니다. Capacity Plan 수립, 배분 현황 추적, 공급 지연이나 수요 급증에 따른 리스크 관리를 위해서는 이 세 조직으로부터 데이터를 취합하고 의사결정을 조율해나갑니다.

    What you will do


    1. Capacity Plan 통합: Supply 조직의 신규 용량 확보 계획과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 지속적으로 업데이트
    2. 신규 Supply 온보딩 조율: Supply 조직이 확보한 신규 클러스터가 검증, 네트워크·스케줄러 연동을 거쳐 플랫폼에서 실제로 판매 가능한 상태가 되기까지의 일정을 SRE/Infra와 조율하고 추적
    3. Demand-side SLA 설계 및 협의 주도: SRE의 SLI/SLO 데이터를 기반으로 고객에게 제시 가능한 SLA 수준을 설계하고, SRE·Product·Sales Leadership과의 협의를 주도해 최종 합의를 이끌어냄
    4. Capacity Allocation Governance: 온디맨드·예약형(RI)·스팟 등 판매 유형별 용량 배분 정책을 수립하고, 실제 배분 현황을 추적·리포팅
    5. Infra Program 리딩: SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트 우선순위를 정하고 실행을 조율
    6. Program Cadence & Reporting: Capacity Review 등 정기 운영 회의체를 설계·운영하고, 팀 내 SWE와 함께 공급-수요 가시화 도구를 기획·구축하며, 경영진 및 유관 조직을 위한 대시보드·리포팅 체계를 구축
    7. Risk & Escalation: 공급 지연, 온보딩 지연, 수요 급증, 인프라 장애 등으로 인한 리스크를 조기에 포착해 관련 조직에 에스컬레이션하고 완화 계획을 함께 수립


    Qualifications


    1. 컴퓨터공학, 산업공학 등 관련 전공 학사 이상 학위 보유
    2. TPM/Product Manager/Project Manager로서 6년 이상의 경험
    3. 클라우드/데이터센터/GPU 인프라의 기술적 구조(컴퓨팅, 네트워크, 스토리지)에 대한 기본적 이해
    4. SLI/SLO 데이터를 근거로 대고객 SLA를 설계하고, 여러 조직 간 합의를 이끌어낸 경험
    5. SRE, SWE, Security Engineer 등 엔지니어 직군과 직접 협업하며 기술적 우선순위를 조율해 본 경험
    6. 엔지니어링, 세일즈, 경영진 등 서로 다른 배경의 이해관계자 간 데이터를 취합해 의사결정을 이끌어낸 경험
    7. 복잡한 프로그램의 리스크와 디펜던시를 구조화하고 관리해 본 경험
    8. SQL 등을 활용해 데이터를 분석하고 대시보드를 구축할 수 있는 분
    9. 비즈니스 레벨의 영어 커뮤니케이션 역량 보유

    Helpful experience (not required)


    1. 대규모 GPU/HPC 클러스터를 운영하는 조직 또는 CSP에서의 Capacity Planning Program의 관리 경력
    2. Site Reliability Engineering 프랙티스(SLO/SLA, On-call, Incident Management/Postmortem)에 대한 이해
    3. SOC2 등 보안/컴플라이언스 프레임워크 관련 프로젝트 참여 경험
    4. CSP/데이터센터와의 조달·계약 프로세스에 대한 이해
    5. Kubernetes, Slurm 등 스케줄링/오케스트레이션 환경에 대한 이해
    6. 스타트업/하이퍼그로스 환경에서 프로세스를 처음부터 설계해 본 경험
    7. 정해진 스코프에 갇히지 않고 다양한 조직을 넘나들며 문제를 해결하는 것에 익숙하신 분
    8. 애매하고 답이 정해지지 않은 문제를 스스로 구조화해서 풀어나가는 것에 익숙하신 분

    Life & Benefit


    함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원

    1. 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
    2. 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
    3. 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
    4. 구성원 간의 1on1 음료 지원


    업무 생산성을 높여 몰입할 수 있는 환경

    1. 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
    2. 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
    3. 월 1회 Allhands + Team Gathering 통한 업무 공유
    4. 늦은 시간까지 근무 시, 야근식대/택시비 지원
    5. 구성원 간의 1on1 음료 지원


    몰입한 만큼 휴식과 생활 편의 지원

    1. 개인 간식비 지원 (월 한도)
    2. 장기근속자 리프레시 휴가 제공
    3. 종합건강검진비 및 휴가 지원 (연 1회)
    4. 입사 N주년 축하 선물 제공
    5. 생일 반차 휴가 제공
    6. 명절 선물, 각종 휴가 및 경조금 지원
    7. 본인 및 배우자 출산휴가비 지원



    Joinning Process


    서류전형 → 과제전형 → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.
    1. 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
    2. 지원서 (경력 세부 기술) 및 포트폴리오를 필수로 제출해주세요. (양식 자유)
    3. Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
    4. 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
    5. 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
    6. 근무 형태
    7. 정규직 (수습 3개월)
    8. 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
  • 근무지
    서울 강남구 테헤란로5길 7 13층
VESSL AI주소 서울특별시 강남구 테헤란로 5길7, 13층 (위워크 강남2호점) ㅣ 사업자 번호 884-81-01731
made withlogo