링크: https://github.com/drumih/turbo-fieldfare
GitHub - drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook
Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook - drumih/turbo-fieldfare
github.com
2,600억(26B) 파라미터급 대형 AI 모델을 램(RAM)이 고작 8GB뿐인 일반 맥북(Apple Silicon Mac)에서 단 2GB의 메모리만 사용하여 성공적으로 구동해낸 최신 오픈소스 프로젝트 'TurboFieldfare' 입니다.
Gemma 4 26B-A4B
구글 딥마인드(Google DeepMind)가 공개한 오픈소스 멀티모달 AI 모델로, "지능은 260억 급으로 높이면서 연산 부담은 40억 급으로 확 줄인 가성비 최고 수준의 AI 모델"입니다.
- 26B (Total Parameters = 260억 개): 모델 전체가 보유하고 있는 지식/전문가 수치(파라미터)의 총합이 260억 개라는 뜻입니다.
- A4B (Active Parameters = 40억 개): Active 4B의 약자로, AI가 질문 하나에 답할 때 실제로 작동시키는 전문가는 단 40억 개(3.8B~4B)뿐이라는 뜻입니다.
핵심 특징
- 압도적인 연산 효율성 (MoE의 힘)
- 보통 260억 개급 모델을 돌리려면 엄청난 고사양 GPU와 메모리가 필요합니다.
- 하지만 Gemma 4 26B-A4B는 실제로 40억 개 수준의 연산량만 쓰기 때문에, 앞서 소개된 TurboFieldfare 같은 스페셜 런타임을 활용하면 고작 8GB RAM을 가진 맥북(Mac) 환경에서도 2GB 메모리만 써서 로컬 구동할 수 있게 됩니다.
- 멀티모달 (Multimodal) 지원
- 글자(Text)뿐만 아니라 이미지(Image)와 동영상(Video)까지 직접 보고 이해할 수 있습니다.
- 사진 속 내용을 분석하거나 시각적 데이터를 추출하는 능력이 뛰어납니다.
- 추론(Reasoning) 및 생각 모드 (Thinking Mode)
- 복잡한 수학 문제나 코딩 문제, 논리적 질문을 받으면 바로 답을 뱉지 않고 내부적으로 단계별 생각(Reasoning) 과정을 거쳐 수준 높은 답변을 도출합니다.
- 방대한 대화 문맥 (256K 컨텍스트 윈도우)
- 한 번에 읽고 기억할 수 있는 텍스트 양이 25만 6천 토큰(약 책 1~2권 분량, A4 용지 380여 장)에 달해, 긴 문서나 거대한 소스 코드를 한꺼번에 집어넣고 분석시키기에 매우 유리합니다.
MoE(Mixture of Experts)
- 기존 AI (Dense Model): 모든 분야(수학, 코딩, 문학, 번역 등)를 혼자 다 공부한 '만능 해결사 1명'입니다. 질문이 들어오면 질문의 난이도나 분야에 상관없이 자기 뇌 전체(모든 파라미터)를 다 써서 생각합니다.
- MoE AI (Sparse Model): 분야별 전문가들이 모인 '종합 컨설팅 로펌'과 같습니다.
- 라우터 / 게이팅 네트워크 (Router / Gating Network): 입구에서 손님의 질문을 보고 어떤 전문가에게 보낼지 결정하는 '매니저'입니다.
- 전문가들 (Experts): 수학 전담, 코딩 전담, 언어 전담 등 각 분야에 특화된 소형 신경망들입니다.
- MoE 구조의 장점
- 연산량(전기·비용) 대폭 절감: 전체 파라미터가 260억 개(26B)라도, 질문 하나당 선택되는 전문가는 38억 개(3.88B) 수준일 수 있습니다. 모델의 '지능(총 파라미터)'은 260억 개급이지만, 실제 질문을 처리하는 '속도와 전기 소모'는 38억 개급 모델 수준으로 가벼워집니다.
- 온디바이스/소형 디바이스에서의 혁신: 앞서 보았던 TurboFieldfare나 Gemma 4 같은 최신 기술들이 8GB RAM을 가진 맥북에서도 돌 수 있는 이유입니다. 전체 전문가 데이터를 RAM에 다 올리지 않고, 매니저가 지정하는 특정 전문가만 그때그때 가져와 연산하면 되기 때문입니다.
어떻게 14.3GB 모델을 2GB RAM으로 돌리나요?
원래 26B(260억 개) 파라미터 크기의 모델을 돌리려면 최소 16GB~32GB 이상의 통합 메모리가 필요합니다. 하지만 이 프로젝트는 MoE(Mixture of Experts, 전문가 혼합) 구조의 특성을 극도로 활용했습니다.
- 상주 메모리 (RAM에는 1.35GB만 상주):
- 모델 전체를 RAM에 올리지 않고, 모든 토큰 연산에 공통으로 필요한 '핵심 코어(1.35GB)'와 대화 문맥(KV 캐시)만 RAM에 항상 올려둡니다.
- 필요한 것만 SSD에서 그때그때 스트리밍 (SSD Streaming):
- Gemma 4 모델은 전체 26B 파라미터 중 한 번에 약 38.8억(3.88B) 개(8개의 전문가)만 활성화되어 연산합니다.
- AI가 다음 단어를 생각할 때 필요한 특정 '전문가(Expert)' 데이터만 초고속 SSD에서 그때그때 병렬로 읽어와(pread) 연산하고 버립니다.
- 결과: 8GB RAM을 가진 M2 맥북 에어에서도 메모리 부족(OOM) 오류 없이 초당 5~6토큰, 성능이 좋은 M5 Pro(24GB)에서는 초당 30~35토큰의 실용적인 속도로 AI 대화를 생성할 수 있습니다.
특징 및 기술적 구성
- 애플 실리콘 최적화 (Swift 6.2 + Metal 4):
- C++이나 기존 프레임워크(MLX, llama.cpp)를 감싸는 형태가 아니라, 애플의 최신 그래픽/연산 API인 Metal 4 커널과 Swift 언어로 완전히 새로 구축한 전용 런타임입니다.
- 스마트 설치 시스템 (Streaming Repack):
- 15GB에 달하는 모델을 다운로드받을 때, 전체 용량을 압축 해제해서 디스크를 이중으로 차지하지 않도록 허깅페이스에서 받아오는 즉시 .gturbo라는 독자적인 스트리밍 포맷으로 직접 재포장(Repack)하여 저장 공간을 절약합니다.
- 다양한 인터페이스 제공:
- 일반 사용자를 위한 네이티브 Mac 앱(GUI)
- 터미널 환경을 위한 CLI 도구
- 다른 앱과 연동할 수 있는 OpenAI 호환 로컬 서버(127.0.0.1:8080)
실제 설치 과정
1. TurboFieldfare 설치
git clone https://github.com/drumih/turbo-fieldfare.git
cd turbo-fieldfare
swift build -c release
.build/release/TurboFieldfareMac
2. Gemma 4 다운로드
Download 선택
다운로드 완료 후 Load Model
간단한 프롬프트를 넣어 정상 작동 확인
3. 로컬 API 서버 실행
swift build -c release --product TurboFieldfareServer
.build/release/TurboFieldfareServer \
--model scratch/gemma4.gturbo
서버가 정상적으로 실행되면 http://127.0.0.1:8080/ 에서 API를 제공합니다.
4. OpenCode 연결
brew install anomalyco/tap/opencode
프로젝트 디렉터리에 opencode.json 파일을 생성합니다.
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"turbo-fieldfare": {
"npm": "@ai-sdk/openai-compatible",
"name": "Local Gemma 4",
"options": {
"baseURL": "http://127.0.0.1:8080/v1",
"apiKey": "local"
},
"models": {
"gemma-4": {
"name": "Gemma 4 26B-A4B"
}
}
}
},
"model": "turbo-fieldfare/gemma-4"
}
5. 실행
실제 프로젝트 폴더에서 실행합니다.
cd ~/Desktop/Myproject
opencode'공부 > 뉴스 기사 읽기' 카테고리의 다른 글
| Qwen3.8-Max: A New Bar for Coding and Cowork (0) | 2026.08.07 |
|---|---|
| Ten advances in mathematics and theoretical computer science (0) | 2026.08.03 |
| Rextio: 적합한 typed Python 함수는 Rust로 컴파일하고, 나머지는 전부 Python fallback으로 유지합니다. (0) | 2026.07.30 |
| 미토스, 전문가 2년 검증 거친 양자내성암호 흔들었다…60시간만 (1) | 2026.07.29 |
| HimitsuObfuscator: A lightweight LLVM-17 obfuscator for any Linux. (0) | 2026.07.28 |
