매일 들어오는 글 가운데, TTJ가 한 번 더 읽어본 것들. 코딩과 AI 시대를 가로지르는 글로벌 동향을 한곳에 모았습니다.
수천 개의 GPU로 대규모 언어 모델을 학습하는 환경에서 하드웨어 장애는 예외가 아니라 상수다. GPU 메모리 오류 하나, 네트워크 단절, 노드 크래시 하나가 며칠 혹은 몇 주 동안 진행된 학습 전체를 무너뜨린다. PyTorch 팀은 이 문제를 정면으로 다루기 위해 단일 컨트롤러(single-controller) 런타임인 Monarch를 AMD Instin...