요약:모든 주요 AI 코딩 모델을 실제로 실행했습니다.머큐리 테크놀로지 솔루션 개발 작업 — 프론트 엔드 및 백 엔드. 순위: 페이블 > 키미 K3 > 클로드 오퍼스 4.8 > 그록 4.5 > 코덱스 5.5 > 키미 2.7 > 클로드 오퍼스 4.6 > GLM 5.2 > 미니맥스. 페이블이 이겼습니다. 가장 큰 모델이기 때문이 아니라, "완료"가 어떤 모습인지 이해하기 때문입니다.
제임스입니다, 머큐리 테크놀로지 솔루션. 홍콩 사이버포트에 있는 내 사무실에서 — 2026년 7월 17일
나는 지난 2주 동안 몇 달 전에 했어야 할 일을 했다: 실제 작업에 대해 모든 주요 AI 코딩 모델을 테스트하는 것이다.
벤치마크도 아니고, LeetCode도 아니고, "리스트를 정렬하는 파이썬 함수를 작성하라"도 아니다. 실제 작업이다. 엣지 케이스를 처리해야 하는 리액트 컴포넌트. 서드파티 서비스와 통합해야 하는 API 엔드포인트. 데이터를 잃을 수 없는 데이터베이스 마이그레이션. 실제로 프로덕션에서 깨지는 것들이다.
우리가 배운 것은 다음과 같다.
방법론: 벤치마크 없이, 전투만
우리는 각 모델에게 동일한 작업을 주었다:
1. 프론트엔드:실시간 데이터 시각화, 오류 처리 및 접근성 준수를 갖춘 반응형 대시보드를 구축합니다.
2. 백엔드:인증, 캐싱 및 부하 시 우아한 저하를 갖춘 속도 제한 API를 설계합니다.
3. 통합:적절한 TypeScript 유형, 오류 경계 및 로딩 상태로 두 개를 연결합니다.
도움 없이. "단계별로 생각하라"는 프롬프트 없이. 단지 고위 엔지니어가 월요일 아침에 받을 사양입니다.
우리는 네 가지 차원에서 점수를 매겼습니다:
• 정확성: 버그 없이 작동합니까?
• 완전성: 엣지 케이스를 처리합니까, 아니면 단순히 행복한 경로만 처리합니까?
• 유지보수성: 다른 엔지니어가 6개월 후에 이를 읽고 수정할 수 있을까요?
• 속도: 프롬프트에서 배포 가능한 코드까지 얼마나 걸리나요?
순위: 무엇이 이겼고 그 이유는?
1. Fable — "완료"되는 다크호스
Fable은 우리의 목록에서 1위를 차지했으며, 솔직히 말해 이 결과는 예상하지 못했습니다. 가장 과대 광고된 모델은 아니며, 가장 많은 매개변수를 가진 것도 아닙니다. 하지만 Fable이 다른 누구보다 잘하는 것은 다음과 같습니다:"코드가 컴파일되는 것"과 "코드가 배포되는 것"의 차이를 이해합니다.
우리의 프론트엔드 작업에서 Fable은 요청하지 않았음에도 불구하고 오류 경계를 생성했습니다. 로딩 스켈레톤을 추가했습니다. 스크린 리더를 위한 적절한 ARIA 레이블을 포함했습니다. 백엔드를 요청했을 때, 속도 제한을 구축했습니다.와 회로 차단기와 캐시 실패 시 사용할 대체 전략.
이 모델은 구문을 막 배운 주니어가 아닌 시니어 엔지니어처럼 생각합니다.
속도도 말도 안 되게 빨랐습니다. Fable은 우리의 세 가지 작업을 12분 만에 완료했습니다. 다음으로 빠른 것은 Kimi K3로 18분이었습니다.
Fable이 이기는 이유: 프로덕션 준비가 완료된 코드를 생성합니다. 데모 코드도 아니고, 튜토리얼 코드도 아닙니다. 첫 번째 프로덕션 중단 이후에만 생각하게 되는 엣지 케이스를 처리하는 코드입니다.
2. Kimi K3 — 신뢰할 수 있는 작업 말
Kimi K3는 실제로 프로덕션 코드에 대해 신뢰하는 모델입니다. Fable만큼 "영리"하지는 않지만 — 당신이 생각하지 못한 우아한 솔루션으로 놀라게 하지는 않을 것입니다. 하지만 버그로 놀라게 하지는 않을 것입니다.
1M 컨텍스트 윈도우는 진정한 킬러 기능입니다. 우리는 전체 코드베이스(47K 라인)를 제공하고 기능 추가를 요청했습니다. 그것은 패턴을 이해하고, 규칙을 따르며, 우리 팀이 작성한 것처럼 보이는 코드를 생성했습니다.
Kimi K3가 빛나는 곳: 긴 컨텍스트 작업, 레거시 코드 리팩토링, 대규모 프로젝트 간의 일관성 유지. "작동"이 "와우"보다 더 중요할 때 원하는 모델입니다.
트레이드 오프:K3는 그린필드 작업에서 Fable보다 느립니다. 컨텍스트를 읽고, 패턴을 이해하고, 적합한 코드를 생성하는 데 시간이 걸립니다. 하지만 그 시간이 3일 후에 신비로운 통합 실패를 디버깅하지 않을 때 보상받습니다.
3. Claude Opus 4.8 — 이론가
Opus 4.8은 방 안에서 가장 똑똑한 모델입니다. 그것은 왜 당신의 아키텍처가 잘못되었는지 설명하고, 세 가지 더 나은 대안을 제안하며, 트레이드오프에 대한 백서를 작성할 것입니다. 또한 단순한 CRUD 엔드포인트를 이벤트 소싱이 있는 분산 시스템으로 과도하게 설계할 가능성이 가장 높은 모델입니다.
Opus 문제: 너무 사려 깊습니다. 30분이 걸려야 하는 작업이 주어지면, Opus 4.8은 디자인 문서에 20분, 구현에 15분을 소비한 다음, 새로운 패턴에 맞게 전체 코드베이스를 리팩토링하라고 제안합니다.
깊은 추론이 필요할 때 — 복잡한 알고리즘, 아키텍처 결정, 보안 분석 — Opus 4.8은 비할 데 없습니다. 금요일까지 배송해야 할 때는 부담이 됩니다.
비용 현실 점검:Opus 4.8은 비쌉니다. "아마 다른 엔지니어를 고용해야 할까" 정도로 비쌉니다. Aider 리더보드에서 1000 작업당 $65.75로, 프리미엄 문제를 위한 프리미엄 도구입니다.
4. Grok 4.5 — 경고가 있는 속도 괴물
Grok 4.5는 빠릅니다. 정말, 실제로 빠릅니다. 8분도 안 되어 프론트엔드 작업을 생성했습니다. 코드가 작동했습니다. 괜찮아 보였습니다.
하지만 백엔드를 스트레스 테스트할 때 — 동시 요청을 보내고, 캐시 실패를 시뮬레이션하고, 엣지 케이스를 테스트할 때 — Grok의 코드가 깨지기 시작했습니다. 행복한 경로는 아름답게 처리했습니다. 불행한 경로는? 그다지 좋지 않았습니다.
Grok은 프로토타입을 위한 모델이지, 생산을 위한 모델이 아닙니다.아이디어를 오후에 검증해야 한다면, Grok이 해결해 줍니다. API가 새벽 3시에 멈추지 않을 것이라는 확신을 가지고 편안하게 잠을 자고 싶다면, 다른 곳을 찾아보세요.
xAI 요소:Grok의 X/Twitter 데이터와의 통합은 실시간 맥락에서 우위를 제공합니다. 그러나 순수한 코딩에 있어서는 그 이점이 더 나은 코드 품질로 이어지지 않습니다.
5. Codex 5.5 — 전문가
Codex 5.5는 모델을 하나의 목적, 즉 코드 생성을 위해 최적화했을 때 발생하는 결과입니다. 이 목록에서 가장 뛰어난 순수 코더입니다. 문법은 완벽하고, 패턴은 관용적이며, 변수 이름은 실제로 의미가 있습니다.
하지만 특정 접근 방식을 선택한 이유를 설명해 달라고 하거나 기술적 결정의 비즈니스적 함의를 고려해 달라고 하면, 침묵하게 됩니다. Codex는 코드를 작성합니다. 코드를 생각하지 않습니다.why it chose a particular approach, or to consider the business implications of a technical decision, and it goes silent. Codex writes code. It doesn't think about code.
Codex를 사용할 때: 당신이 원하는 것이 무엇인지 정확히 알고 있고, 그저 빠르게 입력하기만 하면 됩니다. 이것은 세계에서 가장 비싼 자동 완성 기능입니다 — 그리고 때때로, 그것이 바로 당신이 필요한 것입니다.
OpenAI 생태계: Codex 5.5는 이미 OpenAI 스택에 있을 때 빛을 발합니다. ChatGPT와의 통합, GPT 스타일 출력에 대한 친숙함, 일관된 API — 이는 대담한 선택이 아닌 편안한 선택입니다.
6. Kimi 2.7 — 신뢰할 수 있는 베테랑
Kimi 2.7은 K3가 존재하기 전 우리가 사용했던 모델입니다. 신뢰할 수 있고, 일관되며, 예측 가능합니다. 당신의 마음을 사로잡지는 않겠지만, 코드베이스를 망가뜨리지는 않을 것입니다.
솔직한 평가: K3에 접근할 수 있다면, 2.7을 사용할 이유가 없습니다. 컨텍스트 윈도우만 해도 (256K 대 1M) K3는 다른 도구 범주에 속합니다. 하지만 구형 요금제에 있는 팀이나 레거시 통합이 있는 경우, 2.7은 여전히 완벽하게 유능한 엔지니어입니다.
가격이 적절합니다:Aider 리더보드에서 1000 작업당 $1.24로, Kimi 2.7은 예산 챔피언입니다. 최고의 성능은 아니지만, 최고의 가치를 제공합니다. 최첨단이 필요 없는 팀에 적합합니다.
7. Claude Opus 4.6 — 이전 세대
Opus 4.6은 4.8의 뛰어난 성능을 다듬지 않은 상태로 미리 보여주는 느낌입니다. 과도하게 생각하는 경향은 같지만 정확성은 떨어집니다. 같은 건축적 야망이 있지만 버그가 더 많습니다.
건너뛰세요.Anthropic 생태계에 있다면, 바로 4.8로 가세요. 4.6과 4.8 사이의 차이는 점진적이지 않습니다 — 다른 모델 클래스입니다.
8. GLM 5.2 — 지역 경쟁자
GLM 5.2는 당신이 들어본 적 없는 최고의 모델입니다 — 중국에 있지 않는 한. 이 모델은 우리의 중국어 요구 사항을 어떤 서양 모델보다 잘 처리했으며, 지역 API 생태계(WeChat, Alipay, DingTalk)에 대한 이해는 정말 인상적입니다.
하지만 일반적인 개발 용도로는? 괜찮습니다. 좋지는 않습니다. 괜찮습니다. 코드가 작동하지만, 보수적입니다. 현대적인 패턴을 제안하지 않을 것입니다. 성능을 최적화하지 않을 것입니다. 2022년경에 컴파일되고 실행되는 솔루션을 제공할 것입니다.
Zhipu AI의 관점: GLM은 중국의 주요 LLM 연구소 중 하나인 Zhipu AI의 지원을 받고 있습니다. 중국 시장을 위해 구축하는 팀에게 GLM의 문화적 및 규제적 인식은 진정한 장점입니다. 다른 모든 사람에게는 호기심일 뿐입니다.
9. MiniMax — 진행 중인 작업
MiniMax는 우리의 목록에서 가장 하위에 위치했으며, 팀이 분명히 노력하고 있기 때문에 안타깝게 생각합니다. 하지만 노력하는 것만으로는 배포가 이루어지지 않습니다.
생성된 코드는... 기능적이었습니다. 컴파일되었습니다. 실행되었습니다. 그러나 다른 모든 모델이 포착한 엣지 케이스를 놓쳤습니다. 오류 처리는 최소한이었습니다. TypeScript 타입은 느슨했습니다. 성능을 위해 리팩토링을 요청했을 때, 코드를 더 느리게 만들었습니다.
MiniMax는 그곳에 도달할 수 있습니다.하지만 지금은 프로덕션 개발에 준비되지 않았습니다.
중국 LLM 환경:MiniMax는 Qwen, DeepSeek 및 GLM을 포함하는 혼잡한 분야의 일부입니다. 그 회사에서 MiniMax는 차별화하는 데 어려움을 겪고 있습니다. MiniMax와 DeepSeek-V3.2(74.2% on Aider) 간의 코드 품질 격차는 뚜렷합니다.
누구도 이야기하지 않는 패턴
가장 놀라웠던 것은: 최고의 모델이 가장 큰 모델이 아니라는 것입니다.
Fable은 가장 큰 매개변수 수에서 실행되지 않습니다. Kimi K3는 운영 비용이 가장 비싸지 않습니다. 그러나 두 모델 모두 더 큰 모델들이 놓치는 것을 이해합니다: 배송은 능력이 아닌 사고방식입니다.
우리 목록의 상위 모델들은 하나의 공통점을 가지고 있습니다: 그들은 마치 다른 사람이 유지해야 할 것처럼 코드를 생성합니다. 그들은 주석을 추가합니다. 그들은 오류를 처리합니다. 그들은 토요일 새벽 2시에만 나타나는 엣지 케이스에 대해 생각합니다.
실패한 모델들은? 그들은 코딩 인터뷰처럼 코드를 생성했습니다 — 문제를 해결하고, 테스트를 통과하고, 넘어갑니다. 소프트웨어가 작동하는 방식이 아닙니다. 소프트웨어가 고장나는 방식입니다.
**배송 원칙:** 최고의 코드는 가장 영리한 코드가 아닙니다. 원래 저자가 휴가 중이고 운영 데이터베이스가 불타고 있을 때도 여전히 의미가 있는 코드입니다.
벤치마크가 말하는 것 (그리고 우리가 무시한 이유)
우리가 벤치마크를 사용하지 않았다고 언급했습니다. 하지만 테스트 후에 우리의 경험이 리더보드 데이터와 일치하는지 확인하기 위해 벤치마크를 확인했습니다.
Aider LLM 리더보드 (aider.chat/docs/leaderboards)는 흥미로운 이야기를 들려줍니다:
| 모델 | Aider 점수 | 1K 작업당 비용 | 스타일 | |-------|-------------|-------------------|-------| | GPT-5 (고급) | 88.0% | $29.08 | diff | | o3-pro (고급) | 84.9% | $146.32 | diff | | Gemini 2.5 Pro (32k 생각) | 83.1% | $49.88 | diff-fenced | | Grok 4 (고급) | 79.6% | $59.62 | diff | | DeepSeek-V3.2-Exp | 74.2% | $1.30 | diff | | Claude Opus 4 (32k 사고) | 72.0% | $65.75 | diff | | Kimi K2 | 59.1% | $1.24 | diff | | Grok 3 Beta | 53.3% | $11.03 | diff | | GPT-4.1 | 52.4% | $9.86 | diff | | Claude 3.5 Sonnet | 51.6% | $14.41 | diff |
패턴: 가장 비싼 모델(o3-pro는 $146.32, Opus 4는 $65.75)은 최고의 결과를 보장하지 않습니다. GPT-5는 $29.08로 두 모델을 능가합니다. DeepSeek는 $1.30로 74.2%를 제공하며, Opus 4의 72.0%에 거의 맞먹는 성능을 1/50의 비용으로 제공합니다.
우리의 경험이 이를 뒷받침합니다.Fable과 Kimi K3는 우리가 테스트한 가장 비싼 모델이 아닙니다. 그러나 이들은 일관되게 배포 가능한 코드를 제공한 모델입니다.
이것이 귀하의 팀에 의미하는 바
2026년에 소프트웨어를 개발하고 있다면, 제 조언은 다음과 같습니다:
1. 그린필드 프로젝트에는 Fable을 사용하세요.제로에서 시작하고 모든 것을 망치지 않으면서 빠르게 움직여야 할 때, Fable의 "수석 엔지니어" 직관은 타의 추종을 불허합니다.
2. 레거시 작업에는 Kimi K3를 사용하세요.1M 컨텍스트 윈도우는 기존 코드베이스를 실제로 이해할 수 있게 해주며, 단순히 당신의 규칙을 무시하는 새로운 코드를 생성하는 것이 아닙니다.
3. 아키텍처 결정을 위해 Opus 4.8을 사용하세요.확장해야 하는 시스템을 설계할 때, 보안이 중요할 때, 백만 달러의 기술적 베팅을 할 때 — Opus의 깊이는 과도한 고민의 가치가 있습니다.
4. 프로덕션을 위해 다른 모든 사용을 중단하세요.프로토타입에는 Grok을 사용하세요. 자동 완성을 위해 Codex를 사용하세요. 하지만 심각한 검토 없이 그들의 코드를 사용자에게 배포하지 마세요.
5. 비용 방정식을 고려하세요.머큐리에서는 중요한 작업을 위해 여러 모델을 병렬로 실행합니다. Kimi K3($1.24/1K 작업)와 Opus 4.8($65.75/1K 작업)의 비용 차이는 동일한 예산으로 50배 더 많은 반복을 할 수 있게 해줍니다. 이는 단순히 더 저렴할 뿐만 아니라, 더 빠릅니다.
더 큰 그림
우리는 코딩의 상품화가 실시간으로 진행되는 것을 지켜보고 있습니다. "나는 코드를 쓸 수 있다"와 "나는 제품을 출시할 수 있다" 사이의 간극이 좁아지고 있습니다. Fable이나 Kimi K3를 사용하는 단일 빌더는 예전에는 다섯 명의 팀이 필요했던 작업을 수행할 수 있습니다.
하지만 여기서 중요한 점은:모델들이 대부분의 엔지니어들이 사용하는 것보다 더 빠르게 코딩을 잘하게 되고 있다는 것입니다.
2026년에 성공하는 엔지니어는 가장 많은 코드를 작성하는 사람이 아닙니다. 그들은 올바른 질문을 하고, 생성된 코드를 비판적으로 검토하며, AI의 제안을 수용할 때와 무시할 때를 아는 사람들입니다.
모델은 도구입니다. 판단은 여전히 당신의 것입니다.
양웬리의 말처럼: "가장 효과적인 승리 방법은 적의 전투 의지를 꺾는 것입니다." 2026년의 적은 복잡성입니다. 승리하는 모델은 복잡성을 관리 가능하게 만드는 모델입니다.
머큐리 테크놀로지 솔루션: 디지털화를 가속화하세요.


