brandLogo
GPU Cluster Architect
상시 채용

About the role


VESSL AI GPU Cluster Architect는 CSP/데이터센터 파트너와 전력, 냉각, 네트워크 등 기술적 조건에 대한 협상을 직접 진행하며, 신규 사이트의 Qualification, 클러스터 아키텍처 설계, 하드웨어 구매, 그리고 완성된 클러스터의 검증까지 인프라가 플랫폼에 최적의 구성으로 전달되는 전 과정을 기술적으로 책임집니다. 이 과정은 단순한 페이퍼 기반의 스펙 검토로 끝나지 않습니다. 설비의 도면과 장비 사양을 직접 들여다보고, 건설 중이거나 운영 중인 데이터센터 현장을 방문해 CSP·시공사·벤더와 대면하여 협의하는 일들이 이 역할의 핵심입니다. 대규모 GPU 클러스터/데이터센터의 구축에서 의사 결정 과정은 클러스터 아키텍처와 시스템 레벨의 기술적 이해가 필수적입니다. 협업할 CSP/데이터센터를 기술적으로 검증하고, 인프라가 어떤 스펙으로 구축·검증될지에 대한 기술 기준을 수립함으로서 GPU 공급망의 기술적 품질과 안정성을 담보하는 핵심 역할을 해나갑니다.


VESSL AI는 전 세계 여러 CSP와 데이터센터 파트너의 GPU 자원을 하나의 플랫폼으로 연결해 고객에게 제공합니다. 이를 위해서는 우선 플랫폼이 구축될 데이터센터 캠퍼스가 대규모 GPU Workload를 실제로 감당할 수 있는 부분일지, 계약 전력과 수전 방식, 냉각 용량, 랙당 전력 밀도 등 여러 방면에서 기술적으로 검증하는 일이 필수적입니다. 또한 구축할 클러스터의 Network Topology를 설계하고, 실제 구축이 완료된 클러스터가 설계 스펙대로 동작하는지 Slurm, Kubernetes 기반 스케줄링 환경에서 직접 검증하는 과정을 수행합니다. 이 모든 과정은 하드웨어 구매 단계의 의사결정부터 CSP, 벤더사, 현지 운영사(OpCo), 내부 Sales 조직의 다양한 이해관계자 간 기술적 이견 조율을 요구하는 고도의 기술 역량이 필요합니다.

What you will do


  1. DC/CSP Qualification: 신규·기존 데이터센터가 대규모 GPU 클러스터를 수용할 수 있는지 계약 전력, 수전 방식, 냉각 용량(공랭/액랭, PUE), 랙당 전력 밀도 등을 도면과 장비 사양 레벨에서 직접 검토하고 Go/No-go 판단 기준을 수립
  2. Cluster Architecture Design: IP Plan, Network Topology(Rail-optimized, Fat-tree 등), InfiniBand/RoCEv2 기반 High-speed Network 구성을 설계
  3. Cluster Validation: 구축 완료된 클러스터를 Slurm, Kubernetes 등 스케줄링 환경 위에서 벤치마크·Burn-in 테스트로 검증하고, 하드웨어·OS·드라이버·네트워크 전 레이어에 걸친 성능·안정성 이슈를 직접 진단
  4. Hardware Procurement: GPU 서버, 스위치, 케이블링 등 하드웨어 스펙을 정의하고 벤더/OEM/ODM과 구매·납품 일정을 조율
  5. 기술 협상 및 Stakeholder 조율: CSP, 데이터센터, 네트워크/전력 벤더, 내부 Infra·Sales 팀 등 다양한 이해관계자와의 기술 협상을 리드


Qualifications


  1. 전기전자, 컴퓨터공학 등 관련 전공 학사 이상 학위 보유
  2. GPU/HPC 클러스터 설계 또는 구축·운영 경력 4년 이상 보유
  3. 데이터센터 현장 방문·출장이 가능하며, 현장에서 CSP·운영사(OpCo)·벤더와 직접 대면 협의하는 데 익숙하신 분
  4. InfiniBand, RoCEv2 등 High-speed Fabric 및 Network Topology 설계 경험
  5. 데이터센터 구축/운영 관련 실무 경험 중 아래 2개 이상 충족하신 분
  6. Slurm, Kubernetes 등 스케줄러/오케스트레이션 환경에서 클러스터를 검증·운영해 보신 경험
  7. 데이터센터의 전력(수전, UPS, PDU), 냉각(공랭/수랭) 등 Facility 요구사항을 이해하고 CSP/데이터센터와 직접 기술 협의를 해보신 경험
  8. 수배전·변압기, UPS/PDU, CDU·냉각배관, 배전반 등 DC MEP(전력·냉각·기계) 설비에 대한 실무적 이해 및 엔지니어링 현장 경험
  9. GPU, NIC, PCIe 등 서버·GPU 하드웨어 전반과 OS/드라이버 레벨까지 아우르는 Full-stack 트러블슈팅 능력
  10. NVIDIA Scalable Unit 기준 4SU (Blackwell 2,048장) 규모 이상 단일 GPU 클러스터를 설계·구축·운영해 보신 경험


Helpful experience (not required)


  1. Python, Go 등을 활용한 인프라 자동화 및 텔레메트리 파이프라인(예측적 장애 탐지 등) 구축 경험
  2. KVM, QEMU, libvirt 등 가상화 기술에 대한 이해
  3. Colocation, Powered Shell 등 데이터센터 계약 형태에 대한 이해
  4. 다수 글로벌 지역의 데이터센터/CSP와 협업해 보신 경험
  5. 비즈니스 레벨의 영어 커뮤니케이션 역량을 보유한 분
  6. 정해진 스코프에 갇히기보다, 문제 해결을 위해 필요하면 네트워크·전력·SWE 등 인접 영역까지 넘나드는 extra mile에 거부감이 없으신 분
  7. 모호하거나 답이 정해지지 않은 문제를 마주했을 때, 스스로 구조화해서 답을 찾아가는 것에 익숙하신 분

Life & Benefit


함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원

  1. 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
  2. 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
  3. 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
  4. 구성원 간의 1on1 음료 지원


업무 생산성을 높여 몰입할 수 있는 환경

  1. 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
  2. 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
  3. 월 1회 Allhands + Team Gathering 통한 업무 공유
  4. 늦은 시간까지 근무 시, 야근식대/택시비 지원
  5. 구성원 간의 1on1 음료 지원


몰입한 만큼 휴식과 생활 편의 지원

  1. 개인 간식비 지원 (월 한도)
  2. 장기근속자 리프레시 휴가 제공
  3. 종합건강검진비 및 휴가 지원 (연 1회)
  4. 입사 N주년 축하 선물 제공
  5. 생일 반차 휴가 제공
  6. 명절 선물, 각종 휴가 및 경조금 지원
  7. 본인 및 배우자 출산휴가비 지원



Joinning Process


서류전형 → 과제전형 → Technical/Resume Interview -> Culture Interview → CEO Interveiw 순으로 진행됩니다.
  1. 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
  2. 지원서 (경력 세부 기술) 및 포트폴리오를 필수로 제출해주세요. (양식 자유)
  3. Technical/Resume Interview는 과제 합격자에 한해 과제물 및 유관 경험 중심의 기술 역량적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
  4. 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
  5. 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
  6. 근무 형태
  7. 정규직 (수습 3개월)
  8. 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
직군 / 직무개발 / 클러스터 아키텍트
경력 사항경력 (4년 이상)
고용 형태정규직
근무지

GPU Cluster Architect

개발
클러스터 아키텍트
경력 (4년 이상)
정규직
상시 채용
  • About the role


    VESSL AI GPU Cluster Architect는 CSP/데이터센터 파트너와 전력, 냉각, 네트워크 등 기술적 조건에 대한 협상을 직접 진행하며, 신규 사이트의 Qualification, 클러스터 아키텍처 설계, 하드웨어 구매, 그리고 완성된 클러스터의 검증까지 인프라가 플랫폼에 최적의 구성으로 전달되는 전 과정을 기술적으로 책임집니다. 이 과정은 단순한 페이퍼 기반의 스펙 검토로 끝나지 않습니다. 설비의 도면과 장비 사양을 직접 들여다보고, 건설 중이거나 운영 중인 데이터센터 현장을 방문해 CSP·시공사·벤더와 대면하여 협의하는 일들이 이 역할의 핵심입니다. 대규모 GPU 클러스터/데이터센터의 구축에서 의사 결정 과정은 클러스터 아키텍처와 시스템 레벨의 기술적 이해가 필수적입니다. 협업할 CSP/데이터센터를 기술적으로 검증하고, 인프라가 어떤 스펙으로 구축·검증될지에 대한 기술 기준을 수립함으로서 GPU 공급망의 기술적 품질과 안정성을 담보하는 핵심 역할을 해나갑니다.


    VESSL AI는 전 세계 여러 CSP와 데이터센터 파트너의 GPU 자원을 하나의 플랫폼으로 연결해 고객에게 제공합니다. 이를 위해서는 우선 플랫폼이 구축될 데이터센터 캠퍼스가 대규모 GPU Workload를 실제로 감당할 수 있는 부분일지, 계약 전력과 수전 방식, 냉각 용량, 랙당 전력 밀도 등 여러 방면에서 기술적으로 검증하는 일이 필수적입니다. 또한 구축할 클러스터의 Network Topology를 설계하고, 실제 구축이 완료된 클러스터가 설계 스펙대로 동작하는지 Slurm, Kubernetes 기반 스케줄링 환경에서 직접 검증하는 과정을 수행합니다. 이 모든 과정은 하드웨어 구매 단계의 의사결정부터 CSP, 벤더사, 현지 운영사(OpCo), 내부 Sales 조직의 다양한 이해관계자 간 기술적 이견 조율을 요구하는 고도의 기술 역량이 필요합니다.

    What you will do


    1. DC/CSP Qualification: 신규·기존 데이터센터가 대규모 GPU 클러스터를 수용할 수 있는지 계약 전력, 수전 방식, 냉각 용량(공랭/액랭, PUE), 랙당 전력 밀도 등을 도면과 장비 사양 레벨에서 직접 검토하고 Go/No-go 판단 기준을 수립
    2. Cluster Architecture Design: IP Plan, Network Topology(Rail-optimized, Fat-tree 등), InfiniBand/RoCEv2 기반 High-speed Network 구성을 설계
    3. Cluster Validation: 구축 완료된 클러스터를 Slurm, Kubernetes 등 스케줄링 환경 위에서 벤치마크·Burn-in 테스트로 검증하고, 하드웨어·OS·드라이버·네트워크 전 레이어에 걸친 성능·안정성 이슈를 직접 진단
    4. Hardware Procurement: GPU 서버, 스위치, 케이블링 등 하드웨어 스펙을 정의하고 벤더/OEM/ODM과 구매·납품 일정을 조율
    5. 기술 협상 및 Stakeholder 조율: CSP, 데이터센터, 네트워크/전력 벤더, 내부 Infra·Sales 팀 등 다양한 이해관계자와의 기술 협상을 리드


    Qualifications


    1. 전기전자, 컴퓨터공학 등 관련 전공 학사 이상 학위 보유
    2. GPU/HPC 클러스터 설계 또는 구축·운영 경력 4년 이상 보유
    3. 데이터센터 현장 방문·출장이 가능하며, 현장에서 CSP·운영사(OpCo)·벤더와 직접 대면 협의하는 데 익숙하신 분
    4. InfiniBand, RoCEv2 등 High-speed Fabric 및 Network Topology 설계 경험
    5. 데이터센터 구축/운영 관련 실무 경험 중 아래 2개 이상 충족하신 분
    6. Slurm, Kubernetes 등 스케줄러/오케스트레이션 환경에서 클러스터를 검증·운영해 보신 경험
    7. 데이터센터의 전력(수전, UPS, PDU), 냉각(공랭/수랭) 등 Facility 요구사항을 이해하고 CSP/데이터센터와 직접 기술 협의를 해보신 경험
    8. 수배전·변압기, UPS/PDU, CDU·냉각배관, 배전반 등 DC MEP(전력·냉각·기계) 설비에 대한 실무적 이해 및 엔지니어링 현장 경험
    9. GPU, NIC, PCIe 등 서버·GPU 하드웨어 전반과 OS/드라이버 레벨까지 아우르는 Full-stack 트러블슈팅 능력
    10. NVIDIA Scalable Unit 기준 4SU (Blackwell 2,048장) 규모 이상 단일 GPU 클러스터를 설계·구축·운영해 보신 경험


    Helpful experience (not required)


    1. Python, Go 등을 활용한 인프라 자동화 및 텔레메트리 파이프라인(예측적 장애 탐지 등) 구축 경험
    2. KVM, QEMU, libvirt 등 가상화 기술에 대한 이해
    3. Colocation, Powered Shell 등 데이터센터 계약 형태에 대한 이해
    4. 다수 글로벌 지역의 데이터센터/CSP와 협업해 보신 경험
    5. 비즈니스 레벨의 영어 커뮤니케이션 역량을 보유한 분
    6. 정해진 스코프에 갇히기보다, 문제 해결을 위해 필요하면 네트워크·전력·SWE 등 인접 영역까지 넘나드는 extra mile에 거부감이 없으신 분
    7. 모호하거나 답이 정해지지 않은 문제를 마주했을 때, 스스로 구조화해서 답을 찾아가는 것에 익숙하신 분

    Life & Benefit


    함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원

    1. 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
    2. 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
    3. 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
    4. 구성원 간의 1on1 음료 지원


    업무 생산성을 높여 몰입할 수 있는 환경

    1. 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
    2. 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
    3. 월 1회 Allhands + Team Gathering 통한 업무 공유
    4. 늦은 시간까지 근무 시, 야근식대/택시비 지원
    5. 구성원 간의 1on1 음료 지원


    몰입한 만큼 휴식과 생활 편의 지원

    1. 개인 간식비 지원 (월 한도)
    2. 장기근속자 리프레시 휴가 제공
    3. 종합건강검진비 및 휴가 지원 (연 1회)
    4. 입사 N주년 축하 선물 제공
    5. 생일 반차 휴가 제공
    6. 명절 선물, 각종 휴가 및 경조금 지원
    7. 본인 및 배우자 출산휴가비 지원



    Joinning Process


    서류전형 → 과제전형 → Technical/Resume Interview -> Culture Interview → CEO Interveiw 순으로 진행됩니다.
    1. 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
    2. 지원서 (경력 세부 기술) 및 포트폴리오를 필수로 제출해주세요. (양식 자유)
    3. Technical/Resume Interview는 과제 합격자에 한해 과제물 및 유관 경험 중심의 기술 역량적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
    4. 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
    5. 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
    6. 근무 형태
    7. 정규직 (수습 3개월)
    8. 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
  • 근무지
    서울 강남구 테헤란로5길 7 13층
VESSL AI주소 서울특별시 강남구 테헤란로 5길7, 13층 (위워크 강남2호점) ㅣ 사업자 번호 884-81-01731
made withlogo