Z.ai가 GLM-5.1을 출시: 힘을 잃지 않는 모델

Z.ai가 GLM-5.1을 출시했으며, 이 모델과 이전 세대의 주요 차이점은 한 문장으로 설명할 수 있습니다: 힘을 잃지 않습니다.
AI 코더와의 일반적인 이야기는 이렇습니다: 모델이 작업을 받아 익숙한 기술을 적용하고, 빠르게 초기 결과를 제공한 후 벽에 부딪힙니다. 더 많은 시간을 주어도 소용없습니다. 그냥 제자리에서 빙빙 돌기만 합니다. GLM-5.1은 이 패턴을 깼습니다. 개발자들은 명확한 지표가 없고 다음에 무엇을 할지 스스로 결정해야 하는 장거리 작업에 훈련시키려고 의도적으로 훈련시켰습니다.
결과는 말이 필요 없습니다. SWE-Bench Pro 벤치마크에서 새로운 모델은 GPT-5.4와 Claude Opus 4.6을 능가했습니다. 하지만 골라인이 없는 작업을 어떻게 처리하는지 보는 것이 더 흥미롭습니다.
한 테스트에서 모델에게 Rust로 된 벡터 데이터베이스의 골격이 주어지고 최대 속도를 뽑아내도록 요청했습니다. 일반적으로 이러한 작업의 한계는 50번의 반복입니다. GLM-5.1은 600번 이상 작업을 수행하고 도구 호출을 수천 번 했습니다. 멈추는 대신, 모델은 로그를 자체적으로 분석하고, 병목 현상을 발견하고, 아키텍처 전략을 변경했습니다. 결과 — 기존 최고 결과인 3,547 QPS 대비 21,500 QPS. 6배의 차이입니다.
GPU 커널의 ML 작업 최적화에서도 유사한 그림이 나타났습니다. 모델은 1,000번의 반복 후에도 코드를 가속화할 방법을 계속 찾아 평균 속도 향상이 3.6배에 달했습니다. 비교를 위해, 표준 torch.compile은 약 1.15배 정도입니다.
가장 설명력 있는 시나리오에는 숫자 지표가 전혀 없었습니다. GLM-5.1에게 브라우저에서 처음부터 작동하는 Linux 데스크톱 환경을 구축하도록 요청했습니다. 템플릿도, 힌트도, 모형도 없이. 8시간의 연속 작업 동안 모델은 시스템을 구축했습니다: 파일 관리자, 터미널, 텍스트 편집기, 시스템 모니터, 계산기, 심지어 게임까지 추가했습니다. 더 나아가, 단순히 위젯을 조합한 것이 아니라 스타일을 정교하게 다듬고 모든 것을 통합 인터페이스로 연결했습니다.
업데이트의 본질은 모델이 짧은 작업에서 약간 더 똑똑해진 것이 아닙니다. 모델은 쉬운 승리가 끝나면 포기하지 않고, 수백 번의 반복을 통해 해결책을 체계적으로 개선하는 법을 배웠습니다. 이것이 바로 초안만으로 결과를 판단할 수 없는 복잡한 프로젝트에 대한 실제 도구가 된 이유입니다.
모델은 이미 HuggingFace와 GitHub에서 사용 가능하며, Z.ai API를 통해 작동하는 것을 볼 수 있습니다.