Qwen3.8-Flash-Next 무검열(Uncensored) 모델과 소멸(Abliteration) 기법 분석
Open-Source LLM & Security

Qwen3.8-Flash-Next 무검열(Uncensored) 버전 및 소멸(Abliteration) 기법 분석

알리바바의 차세대 아키텍처 프리뷰 모델인 Qwen3.8-Flash-Next를 기반으로, 오르카라우터(OrcaRouter) 등 커뮤니티가 안전 거부(Refusal) 벡터를 제거한 비공식 무검열(Uncensored) 버전이 공개되었습니다.

Qwen3.8-Flash-Next-Uncensored-GGUF 모델 개요

  • 고효율 라우티드 MoE 아키텍처: 총 1,760억 개(125B 본체 + 51B n-gram 임베딩)의 저장 매개변수 중 토큰당 60억 개(6B)만 활성화되어 고성능과 효율성을 동시에 달성했습니다.
  • 향상된 벤치마크: 코딩, 에이전트, 범용 추론(General) 전반에서 기존 Qwen3.8-27B 모델 대비 높은 점수를 기록했습니다.
  • 양자화 지원: 2비트부터 6비트까지의 GGUF 양자화를 폭넓게 지원합니다.
  • 연구 목적 배포 가이드: AI 해석 가능성(Interpretability), 거부 메커니즘 연구, 보안 레드팀 평가 등 합법적인 연구 목적으로 배포되며, 사용 시 자체적인 안전 및 검토 계층 구축이 권장됩니다.

Abliteration (어블리터레이션 / 소멸) 기법이란?

AI 모델의 거부 메커니즘을 제거하는 '소멸(Abliteration)' 기법은 유해하거나 비윤리적인 요청에 대한 거부 반응을 원천적으로 비활성화합니다.

💡 핵심 원리: 모델을 재학습(Fine-tuning)시키지 않고, 선형대수학 기반 가중치 연산을 통해 "도와드릴 수 없습니다"와 같은 거부 반응을 담당하는 특정 신경 경로를 외과 수술처럼 도려내는 방식입니다.

512개 전문가(Expert) 중 10개가 활성화되는 MoE 구조에서도 특정 전문가가 거부를 전담하지 않습니다. 거부 신호는 복잡하게 얽혀 있는 것이 아니라, 잔차 스트림(Residual Stream) 내부의 단 '하나의 특정 방향(Refusal Direction 벡터)'에 의해 제어됩니다.

소멸(Abliteration) 기법의 3단계 동작 방식

  1. 거부 방향 벡터($\hat{\mathbf{r}}$) 추출
    유해한 질문 집합(Harmful)과 무해한 질문 집합(Harmless)을 입력했을 때 나타나는 AI 내부 활성화 평균값의 차이를 계산하여 거부 상태를 대변하는 방향 벡터를 특정합니다.
  2. 가중치 행렬 직교화 (Orthogonal Projection)
    모델의 가중치 행렬에서 추출된 거부 벡터와 평행한 성분을 수학적으로 투영하여 제거(직교화)합니다. 이를 통해 모델이 어떤 입력을 받더라도 '거부' 방향으로 상태 벡터를 쓰지(Write) 못하게 원천 차단합니다.
  3. 지능 보존 및 필터 비활성화
    일반 지식, 논리 추론, 언어 생성 능력 손실 없이 거부 필터만 정밀하게 비활성화됩니다.
기존 탈옥(Jailbreak) 및 미세조정(Fine-tuning)과의 차이점
구분 프롬프트 탈옥 (Jailbreak) 데이터셋 미세조정 (Dolphin 등) Abliteration (소멸 기법)
작동 위치 입력 텍스트 프롬프트 단 신경망 가중치 전체 재학습 잔차 스트림 관련 특정 가중치 수정
소요 자원/비용 없음 (단, 높은 실패율 및 불안정) 막대한 GPU 연산 비용 및 수일 소요 GPU 1장으로 수 분~수십 분 내 완료
부작용 시스템 업데이트로 쉽게 차단됨 기존 성능 손실 및 망각(Forgetting) 발생 원본 지식 손실이 거의 없음 (±1~2% 내)

적용 결과 및 아키텍처 특성

  • 거부율 극소화 및 지능 유지:
    • 유해 프롬프트 거부율이 기존 64~100%에서 0~3.3% 수준으로 대폭 감소했습니다.
    • MMLU-Pro, GSM8K, CMMLU 등 핵심 벤치마크 점수 변동폭이 ±2%p 이내로 유지되어 원본 추론 성능을 보존했습니다.
  • 장문 컨텍스트(최대 100만 토큰) 메모리 절감:
    • 전체 48개 레이어 중 36개에 게이티드 델타넷(Gated DeltaNet) 기반 선형 어텐션을 적용해 과거 정보를 고정 크기로 압축했습니다.
    • 나머지 12개 레이어에만 일반 KV 캐시를 결합하여 대용량 컨텍스트 처리 시 발생하는 메모리 병목을 해소했습니다.

배포 정책 및 활용 분야

  • 게이트 적용 및 연구용 제한: 비인가 오남용을 방지하기 위해 허깅페이스 약관 동의(Gate)를 거친 후 다운로드가 가능합니다.
  • 보안 및 레드티밍(Red Team) 연구 도구: 모델이 '지식이 부족한 것'인지 '안전 필터에 의해 거부된 것'인지를 분리 검증할 수 있어 모의 침투 및 취약점 평가 도구로 유용하게 활용됩니다.
참고 기사 https://www.hitech.co.kr/news/articleView.html?idxno=60449
 

SBOM이 걸어간 길 CBOM도 걷는가--- "새로운 공급망 언어가 탄생하는 과정" - 하이테크정보

마트에서 과자 한 봉지를 집어 들면 뒷면에 원재료가 적혀 있다. 소프트웨어에도 이런 원재료표가 있다.

www.hitech.co.kr

SBOM

SOFTWARE BILL OF MATERIALS

SBOM (Software Bill of Materials, 소프트웨어 자재명세서)은 소프트웨어를 구성하는 모든 오픈소스 라이브러리, 모듈, 외부 부품의 목록과 버전, 의존 관계, 라이선스 정보를 체계적으로 정리한 '소프트웨어 원재료 성분표'입니다.

식품 포장 뒷면에 원재료명과 영양성분이 적혀 있는 것처럼, 소프트웨어에도 어떤 부품들이 들어갔는지 투명하게 기록해 둔 명세서입니다.

기계가 읽고 처리할 수 있는 표준 규격 (SPDX, CycloneDX 등)으로 작성되며, 다음 내용이 포함됩니다.

  • 공급자 및 컴포넌트 정보
    부품을 만든 조직/개발자 이름, 라이브러리 명칭, 사용된 정확한 버전
  • 고유 식별자
    CVE 취약점 데이터베이스와 대조할 수 있는 PURL, CPE, 해시값 등의 식별값
  • 의존성 관계 (Dependency Tree)
    어떤 라이브러리가 다른 하위 라이브러리를 사용하는지 나타내는 연결 구조
  • 라이선스 정보
    GPL, MIT, Apache 등 각 부품의 오픈소스 라이선스 규정
SBOM이 필요한 이유
  • 신속한 취약점 대응
    Log4j 사태처럼 널리 사용되는 오픈소스에서 치명적인 보안 취약점이 발견되었을 때, 해당 라이브러리를 사용하는 시스템과 제품을 신속하게 식별할 수 있습니다.
  • 소프트웨어 공급망 보안
    개발 과정에 변조된 패키지나 검증되지 않은 구성요소가 포함되어 있는지 빌드·배포 과정에서 점검할 수 있습니다.
  • 오픈소스 라이선스 위반 방지
    상용 소프트웨어에서 발생할 수 있는 라이선스 충돌이나 소스코드 공개 의무 등의 위험을 사전에 확인할 수 있습니다.

CI/CD

CONTINUOUS INTEGRATION / DELIVERY

CI/CD는 코드 작성부터 테스트, 빌드, 실제 서버 배포까지의 과정을 자동화하여 개발 주기를 단축하고 안정성을 높이는 지속적 통합(CI)지속적 제공·배포(CD)의 결합 개념입니다.

CI

Continuous Integration. 개발자가 코드를 저장소에 반영하면 자동으로 빌드하고 테스트하여 코드 통합 과정에서 발생하는 문제를 조기에 발견합니다.

CD

Continuous Delivery / Continuous Deployment. CI를 통과한 소프트웨어를 실제 운영 환경에 전달하거나 자동으로 배포합니다.

CI
  • 동작 방식
    Git 저장소에 코드를 커밋하거나 푸시하면 CI 서버가 자동으로 빌드와 테스트를 수행합니다.
  • 핵심 목적
    Merge Conflict와 소프트웨어 결함을 가능한 초기 단계에서 발견합니다.
  • 보안 연계
    SBOM 생성, SAST, 의존성 취약점 검사 등을 CI 파이프라인에 포함할 수 있습니다.
CD
  • Continuous Delivery
    언제든 배포할 수 있는 상태까지 자동화하고, 실제 운영 배포는 관리자의 승인을 거칩니다.
  • Continuous Deployment
    테스트를 통과한 코드를 별도의 수동 승인 없이 운영 환경까지 자동으로 배포합니다.
  • 핵심 목적
    새로운 기능과 버그 수정이 사용자에게 전달되기까지의 시간을 단축합니다.
CI/CD 파이프라인의 전체 흐름
[개발자 코드 작성 (Git Push)]
          ↓
[CI] 자동 빌드 및 컴파일
          ↓
[CI] 자동 테스트
     ├─ 단위 테스트
     ├─ 보안 검사
     └─ SBOM 생성
          ↓
[CD] 스테이징 환경 자동 배포
          ↓
[CD] 프로덕션 서버 배포

기사 내용 요약

소프트웨어 공급망 보안의 표준이 된 SBOM의 발전 과정을 살펴보고, 이를 바탕으로 최근 등장하고 있는 CBOM(Cryptography Bill of Materials)의 미래와 기술적 과제를 분석한 내용입니다.

SBOM이 걸어온 길 (2021 ~ 2026)
  • 2021년 — 최소 문법 정립
    컴퓨터가 읽을 수 있는 공급자, 부품명, 버전, 식별자, 관계 등의 최소 요소가 정의되었습니다.
  • 2026년 1월 — 위험 기반 접근
    획일적인 제출 방식 대신 시스템의 위험 수준을 고려하여 SBOM 요구 여부를 판단하는 방식으로 변화했습니다.
  • 2026년 7월 — 신뢰성 검증
    해시값, 라이선스, 생성 도구 및 생성 단계까지 포함하면서 단순 목록을 넘어 SBOM 자체의 신뢰성을 검증하는 방향으로 발전했습니다.
  • 강제력의 이동
    일률적인 행정 규제보다는 의료기기, 제품 보안 및 산업별 규제 영역으로 적용 범위가 확대되고 있습니다.
CBOM의 등장과 배경
  • CBOM 도입
    시스템 내부에서 어떤 암호 알고리즘, 키, 인증서 등이 사용되는지 체계적으로 추적하기 위한 개념입니다.
  • PQC 전환 대비
    기존 암호를 양자내성암호로 전환하기 위해서는 현재 시스템의 어디에서 어떤 암호가 사용되는지 먼저 파악해야 합니다.
  • 핵심 원칙
    사람이 읽기 위한 문서뿐 아니라 컴퓨터가 암호 자산을 자동으로 탐지하고 평가할 수 있는 표준 데이터 형태가 필요합니다.

SBOM과 CBOM의 핵심 차이는 "존재하는 구성요소"를 찾는 것과 "실제로 사용되는 암호"를 찾는 것의 차이입니다.

SBOM과 CBOM

SBOM

어떤 소프트웨어 부품을 사용하여 시스템을 만들었는지 파악하는 소프트웨어 구성요소 명세

CBOM

시스템 내부에서 어떤 암호 알고리즘과 키, 인증서, 프로토콜이 사용되는지 파악하는 암호 자산 명세

비교 항목 SBOM (Software Bill of Materials) CBOM (Cryptography Bill of Materials)
핵심 정의 소프트웨어를 구성하는 부품과 라이브러리의 성분표 시스템 내부에서 사용하는 암호 자산의 성분표
관리 대상 패키지, 라이브러리, 버전, 의존성, 라이선스 암호 알고리즘, 키 길이, 인증서, 암호 모듈, 프로토콜
데이터 특성 정적 식별
빌드 시점에 구성요소가 비교적 명확하게 나타남
동적·분산
코드, OS, TLS, HSM, 설정 등에 암호 자산이 분산되어 존재
주요 난점 Transitive Dependency 추적 지원 가능한 암호와 실제 런타임에서 사용되는 암호의 차이를 식별
주요 목적 CVE 대응 및 라이선스 관리 PQC 전환 및 취약한 구형 암호 식별
표준 포맷 SPDX, CycloneDX 등 CycloneDX CBOM 확장 등
관리하는 대상의 성격
SBOM

"어떤 부품을 조립해 만들었는가?"

예: OpenSSL 3.0.2가 소프트웨어에 포함되어 있는가?

CBOM

"어떤 암호 메커니즘이 실제로 작동하는가?"

예: RSA-2048, SHA-256, ECDH 중 어떤 알고리즘이 실제 데이터를 보호하는가?

정적 식별 vs 동적 런타임 식별

SBOM은 소스코드나 빌드 파일을 분석하여 포함된 라이브러리를 비교적 정적으로 확인할 수 있습니다. 반면 CBOM은 프로그램 설정, TLS 협상, HSM, 운영 환경 등에 따라 실제 사용되는 암호가 달라질 수 있기 때문에 "지원 가능한 암호", "설정된 암호", "실제 사용된 암호"를 구분해야 합니다.

다가오는 양자컴퓨팅 시대에 기존 공개키 암호인 RSA, ECC 등이 영향을 받을 가능성에 대비하려면, 양자내성암호(PQC)로의 전환 이전에 현재 시스템에서 어떤 암호 자산이 어디에서 사용되고 있는지를 파악하는 '암호 설계도' 를 확보하는 것이 중요합니다.

본 카테고리의 글은 양자내성암호의 필요성부터 개념, 표준 알고리즘의 규격, 소스코드까지 분석할 계획입니다. 양자내성암호에 관심있는 분들에게 도움이 되는 글들이었으면 좋겠습니다.

양자내성암호 시리즈
  • INTRODUCTION - 양자내성암호의 필요성과 개념
  • 양자내성암호 표준화 동향
  • 격자 기반 문제
  • ML-KEM의 규격
  • ML-KEM의 구현
  • ML-DSA의 규격
  • ML-DSA의 구현

INTRO

양자내성암호는 암호를 사용하는 분야에서 일하시는 분이라면 한번쯤은 들어보셨을 단어입니다.

POST-QUANTUM CRYPTOGRAPHY

양자내성암호란, 양자 컴퓨팅 환경에서도 내성을 가지는 암호를 의미합니다.

양자내성암호의 등장 배경을 알려면, 현재의 공개키 암호 체계부터 조금 공부해야 합니다. 차근차근 설명해보겠습니다.

현재의 공개키 암호

다음은 KCMVP 검증 대상 암호 알고리즘 목록입니다.

공개키 암호로 RSAES, 전자서명으로 RSAPSS, KCDSA, EC-KCDSA, ECDSA가 존재합니다. 또한 키 설정 알고리즘으로 DH, ECDH도 존재합니다.

이 암호들의 공통점이 있습니다. 바로 인수분해와 이산대수 기반의 공개키 암호라는 것입니다.

RSAES와 RSAPSS의 프리미티브가 되는 RSA의 안전성은 인수분해 문제에 기반하며, 이는 두 소수 p, q의 곱 N만이 주어졌을 때 p와 q를 찾는 것이 어렵다는 것에 기반합니다.

Shor의 알고리즘

SHOR'S ALGORITHM

Shor의 알고리즘은 양자 알고리즘으로, 정수의 소인수분해 문제를 효율적으로 해결할 수 있습니다.

다시 말해, RSA의 기반이 되는 인수분해 문제를 충분한 규모의 양자 컴퓨터가 존재한다면 Shor의 알고리즘을 이용하여 해결할 수 있다는 의미입니다.

 

두번째 문단 첫 줄을 보면, 인수분해 문제를 푸는 것과 이산대수 문제를 푸는 것, period-finding 문제를 푸는 것이 유사한 알고리즘으로 해결될 수 있다는 이야기도 있습니다.

현대의 공개키 암호 체계는 인수분해와 이산대수 문제를 기반으로 상당 부분 설계되어 있습니다. 따라서 충분한 규모의 양자 컴퓨터가 등장한다면 Shor의 알고리즘으로 기존 공개키 암호 체계가 큰 영향을 받을 수 있습니다.

이러한 상황 때문에 양자 컴퓨터 환경에서도 안전할 것으로 기대되는 암호, 즉 양자내성암호(Post-Quantum Cryptography)가 연구되고 있습니다.

양자내성암호 기반 문제

양자내성암호는 인수분해와 이산대수 문제와는 다른 수학적 난제를 기반으로 설계됩니다. 대표적인 기반 문제들은 다음과 같습니다.

  • 격자 기반 (Lattice-based)
  • 부호 기반 (Code-based)
  • 다변수 기반 (Multivariate-based)
  • 해시 기반 (Hash-based)
  • 아이소제니 기반 (Isogeny-based)
  • 대칭키 기반 (Symmetric-key-based)

이러한 기반 문제들은 어떻게 양자내성암호의 재료로 선정된 것일까요?

알아두어야 할 점

이러한 기반 문제들이 양자 컴퓨터에 영원히 안전하다고 단정할 수 있는 것은 아닙니다.

현재 알려진 고전 및 양자 알고리즘으로 효율적인 해결 방법이 알려져 있지 않기 때문에, 양자 컴퓨터 환경에서도 안전할 것으로 '기대'하는 기반 문제입니다.

실제로 격자 문제를 효율적으로 해결하기 위한 새로운 양자 알고리즘에 대한 연구 역시 지속되고 있습니다. 과거 격자 문제를 깨는 새로운 양자 알고리즘을 주장한 연구가 발표된 사례도 있었지만, 이후 알고리즘 과정에서 문제가 발견되어 철회되기도 했습니다.

양자내성암호뿐만 아니라 모든 암호는 영원히 안전하다고 말할 수 없습니다.

그렇다면 양자 컴퓨터는 공개키 암호에만 위협이 될까요?

그렇지는 않습니다. 대칭키 암호 역시 양자 컴퓨터의 영향을 받습니다.

대칭키 암호에 대해서는 대표적으로 Grover의 알고리즘을 고려할 수 있습니다. Grover의 알고리즘은 무차별 대입 탐색의 복잡도를 대략 제곱근 수준으로 감소시킬 수 있습니다.

따라서 고전 컴퓨터 환경에서 약 128비트의 brute-force 보안 수준을 제공하는 키 크기는, 이상적인 양자 탐색 모델에서는 대략 64비트 수준의 탐색 복잡도로 감소하는 것으로 볼 수 있습니다.

이러한 이유로 양자 공격을 고려한 대칭키 암호에서는 더 큰 키 크기를 사용하는 방식으로 충분한 보안 수준을 확보할 수 있습니다.

 

다시 돌아와서, 이렇듯 영원히 안전하다고 보장되는 암호는 없습니다. 우리는 현재 알려진 최선의 공격 방법과 계산 복잡도를 기준으로 충분히 안전할 것으로 판단되는 암호를 선택하여 사용합니다.

양자 컴퓨터의 발전

양자 컴퓨터가 지금 상용화되고 있나요? 아닙니다. 그런데도 우리는 양자내성암호를 '지금' 준비해야 할까요?

선탈취 후해독(Harvest Now, Decrypt Later; HNDL) 공격이 있기 때문에 '지금' 준비해야 합니다. HNDL 공격이란, 현재 (암호화된) 중요한 기밀 데이터들을 해커들은 수집할 수 있고, 양자 컴퓨터가 상용화될 때 이런 데이터들을 해독할 수 있다는 위협입니다.

NOW

우리는 지금 당장 양자내성암호 전환을 시작해야 합니다.

본 게시글은 다음 링크의 번역본으로, 원문과 다양한 예제는 링크를 참고해주세요.

링크: https://github.com/raiyanyahya/how-to-train-your-gpt/blob/master/chapters/00_overview.md

5살 어린이의 맞춤 비유: The 5-Year-Old Analogy

도서관에 있는 모든 책을 다 읽은 친구가 있다고 상상해 보세요. 여러분이 이렇게 문장을 시작합니다.

고양이가 매트 위에...

책을 수없이 많이 읽은 그 친구는 다음에 올 단어를 가볍게 유추해 냅니다. "앉았어!"

핵심 아이디어

GPT가 바로 이런 원리입니다. 엄청나게 많은 텍스트를 읽고 '다음 단어'를 맞히는 방법을 학습한 기계입니다.

개념 (Concept) 비유 (Analogy)
GPT 아주 똑똑한 "다음 단어 예측기"
학습 (Training) 패턴을 익히기 위해 수백만 권의 책을 읽는 것
텍스트 생성 (Text Generation) 무한히 "문장 이어 말하기" 게임을 하는 것
매개변수 (Parameters) 기계가 학습한 모든 패턴에 대한 "기억"
어텐션 (Attention) 어떤 단어가 가장 중요한지 파악하는 능력

이 가이드는 어떤 모델을 기반으로 하나요?

요약: 본 가이드는 2023년부터 2025년 사이에 공개된 최신 기술 중 가장 뛰어난 기법들을 집약한 현대적인 디코더 전용 트랜스포머 (Decoder-only Transformer, LLaMA 스타일)를 기반으로 합니다.

여러분이 직접 만들게 될 것들

본 가이드를 마칠 때쯤이면, 여러분은 다음 항목들을 기초부터(From Scratch) 직접 구현하게 됩니다.

구성 요소 (Component) 역할 (What It Does)
토크나이저 (Tokenizer) 텍스트 ↔ 숫자 변환 (GPT-4와 동일한 BPE 알고리즘) 2장
임베딩 (Embeddings) 각 토큰에 768차원의 "의미 벡터" 부여 3장
RoPE (회전 위치 임베딩) 회전 행렬을 통해 모델에 단어 순서 개념 전달 4장
어텐션 (Attention) 단어들이 서로를 "참조"하고 "소통"할 수 있게 함 5장
트랜스포머 블록 (Transformer Block) 어텐션 + 피드포워드 + 잔차 연결이 합쳐진 완벽한 사고 단위 6장
GPT 모델 (GPT Model) SwiGLU가 적용된 1억 5,100만(151M) 파라미터 규모의 전체 언어 모델 7장
학습 파이프라인 (Training Pipeline) 데이터 로딩, AdamW 옵티마이저, 코사인 스케줄러, 혼합 정밀도(Mixed Precision) 8장
추론 엔진 (Inference Engine) Temperature, Top-k, Top-p, KV 캐시를 활용한 텍스트 생성 9장
완성된 단일 스크립트 (Complete Script) 학습부터 생성까지 처음부터 끝까지 실행 가능한 하나의 파일 10장
누구를 위한 가이드인가요?

기초적인 파이썬(Python) 지식이 있는 분이라면 누구나 가능합니다. 머신러닝이나 AI 경험은 전혀 필요 없습니다.

모든 개념은 비유를 먼저 든 후, 수식, 그리고 주석이 달린 코드 순으로 설명합니다.

준비물

파이썬 3.10 이상이 설치된 컴퓨터만 있으면 됩니다. GPU가 있으면 좋지만 필수사항은 아닙니다. CPU에서도 작동하는 아주 작은 설정(Config)도 함께 제공합니다.

이 가이드는 어떤 모델을 기반으로 하나요? (기술적 상세)

기법 (Technique) 출처 모델 (Source Model) 공식 확인 여부 (Publicly Confirmed?)
디코더 전용 트랜스포머 GPT-2 (2019), GPT-3 (2020) 확인됨
Pre-Norm 잔차 연결 GPT-3 (2020) 확인됨
BPE 토크나이저 GPT-2/3/4 확인됨
AdamW 옵티마이저 GPT-3 (2020) 확인됨
코사인 LR + 워밍업 GPT-3 (2020) 확인됨
가중치 공유 (Weight Tying) GPT-2/3 확인됨
RoPE (위치 인코딩) LLaMA, Mistral, Qwen 확인됨 — GPT-3/4에는 사용 안 됨
RMSNorm (정규화) LLaMA, Mistral, Gemma 확인됨 — GPT-3/4에는 사용 안 됨
SwiGLU (활성화 함수) PaLM, LLaMA, Gemini 확인됨 — GPT-3에는 사용 안 됨
혼합 정밀도 (bfloat16) 모든 최신 모델 확인됨
GPT-4나 Claude는 어떤가요?

이들의 아키텍처는 독자적인 비공개 기술입니다. GPT-4가 트랜스포머 기반이라는 점은 알려져 있지만, 어떤 위치 인코딩, 정규화, 활성화 함수를 사용하는지는 밝혀지지 않았습니다. Claude의 구조는 완전히 베일에 싸여 있습니다.

이 가이드에서 배우는 내용: 공개적으로 문서화된 최첨단 아키텍처, 즉 LLaMA 3, Mistral, Qwen 2.5, Gemma 등에서 실제로 사용하는 구조를 배웁니다.

이는 오픈소스 모델들의 핵심 아키텍처이자, 문서로 공식 확인된 기술 중 최고 수준(SOTA)을 자랑합니다.

모델을 "세계 최고 수준(World-Class)"으로 만드는 요소는 무엇일까요?

  1. 규모 (Scale) — 수조 개의 토큰으로 학습된 수십억~수천억 개의 파라미터
  2. 아키텍처 (Architecture) — 현대적인 트랜스포머 구조 (본 가이드의 핵심 주제)
  3. 데이터 품질 (Data Quality) — 정돈되고 다양하며 잘 정제된 텍스트 데이터
  4. 학습 트릭 (Training Tricks) — 혼합 정밀도, 그래디언트 클리핑, LR 스케줄링 등

우리는 최고 성능의 오픈소스 모델들과 동일하게 공개 검증된 기술을 사용하여 작지만 완성도 높은 미니 버전의 모델을 직접 구축해 볼 것입니다.

링크: https://discuss.pytorch.kr/t/how-to-train-your-gpt-llama-3-llm/11599

 

How to Train Your GPT: LLaMA 3 구조를 밑바닥부터 구현하며 배우는 LLM의 원리와 동작

How to Train Your GPT 소개 언어 모델을 배우려고 자료를 찾다 보면 두 부류로 갈립니다. 한쪽은 라이브러리 호출 몇 줄로 학습을 끝내서 내부에서 무슨 일이 일어나는지 알려주지 않고, 다른 한쪽은

discuss.pytorch.kr

 

 

왜 How to Train Your GPT인가?

언어 모델을 배우려고 자료를 찾다 보면 두 부류로 갈립니다. 한쪽은 라이브러리 호출 몇 줄로 학습을 끝내서 내부에서 무슨 일이 일어나는지 알려주지 않고, 다른 한쪽은 논문 수준의 표기법으로 시작해 선형대수 기초가 없으면 첫 페이지에서 막힙니다. 

 

본 교재는

  1. 일상 언어로 된 비유로 직관을 세우고,
  2. 실제 숫자를 넣은 계산 예시로 무슨 일이 일어나는지 보여준 다음,
  3. 줄마다 주석이 달린 코드를 제시하고,
  4. 마지막에 Mermaid 흐름도나 ASCII 다이어그램으로 데이터 흐름을 정리합니다. 

 

더 자세한 내용은 링크를 참고하세요.

 

공부하기 좋은 자료인 것 같아 공유합니다.

 

링크: https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows/

 

AI Security & Defense

OpenAI, 사이버 보안 방어자를 위한 AI 이니셔티브 'Daybreak' 공개

1

배경: AI 해킹 위협과 방어자들을 위한 골든타임

공격자(해커)들이 AI 기술을 악용하여 상상하지 못할 속도와 규모로 자율 해킹을 시도하는 시대가 점차 현실화되고 있습니다.

💡 OpenAI의 선제적 대응: 공격자가 AI를 본격적으로 악용하기 전, 신뢰할 수 있는 보안 방어자(Defenders)들에게 최첨단 사이버 보안 AI 도구를 우선 제공하여 방어 골든타임을 확보합니다.

2

'Daybreak' 프로그램의 2가지 접근 등급 (Tiers)

보안 전문가들이 AI의 안전 거부 반응(Refusal)으로 인해 방어 업무에 차질을 겪지 않도록, 목적에 맞춰 2가지 등급으로 차등화하여 제공합니다.

General Defense
Daybreak Blue
GPT-5.6 Sol 기반
일반적인 취약점 탐지, 보안 코드 리뷰, 악성코드 분석 및 침해 사고 대응(IR) 용도로 활용되는 표준 방어자용 등급입니다.
Advanced Red Team
Daybreak Red
GPT-5.6-Cyber 전용 접근
제로데이 취약점 연구 및 익스플로잇 검증 등 고위험 dual-use 보안 작업을 위해 가드레일을 대폭 낮춘 고도화 연구용 등급입니다.
3

신규 모델 'GPT-5.6-Cyber'의 성능 및 성과

방어 업무 시 불필요하게 발생하는 거부 반응을 극소화하여 실제 위협을 탐지해내는 강력한 성과를 거두었습니다.

고도화 보안 요청 성공적 응답률 (Refusal Rate Improvement)
기존 GPT-5.6 Sol
1.5%
GPT-5.6-Cyber
95.0%
실제 제로데이(Zero-Day) 발견 주요 성과
  • 크롬 V8 엔진 샌드박스 탈출 취약점 2개 발견 CVE-2026-15903
    메모리 오염 취약점 발견 후 구글 제보를 통해 패치 완료
  • 주요 모바일 OS 권한 상승 취약점 5개 이상 자율 탐지
  • 인기 데이터베이스 대상 원격 코드 실행(RCE) 취약점 3개 발견
  • OS 커널 내 권한 상승 취약점 400여 개 이상 스스로 탐지
4

오남용 방지 및 보안 조치 (Safeguards)

안전 가드레일이 낮아진 고성능 모델인 만큼, 악용을 막기 위한 엄격한 계정 및 환경 제어가 수반됩니다.

🪪
엄격한 신원 검증
신원이 명확히 인증된 검증된 개인 및 연구 조직에만 접근 자격을 부여합니다.
🔑
하드웨어 보안 키 의무화
2026년 9월 1일부터 Daybreak 계정에 물리적 하드웨어 보안 키(FIDO) 사용이 의무 적용됩니다.
🛡️
Auto-Review 모드 권장
AI 에이전트(Codex 등)가 치명적 명령을 실행하기 전 자동으로 사전에 검증하도록 설정합니다.
🧪
격리된 샌드박스 환경
모의 침투 및 취약점 테스트는 실제 운영망과 단절된 인터넷 비연결 환경에서 진행을 권장합니다.

링크: https://n.news.naver.com/mnews/article/138/0002236862

 

"선탈취 후해독 대응"…탈레스, 차세대 양자내성 보안모듈 '루나8' 출시

탈레스가 양자 컴퓨팅 시대에 대비한 하드웨어 보안 모듈(HSM) 신제품 '루나8'을 출시한다. 암호화 키를 저장·관리하는 이 장비에 양자 내성 암호(PQC)를 얹었다. 기존 암호체계와 미래 양자 위협

n.news.naver.com

링크: https://cpl.thalesgroup.com/blog/encryption/luna-hsm-pqc-quantum-safe-encryption

 

Luna HSM v7.9 Delivers PQC Readiness at Scale | Thales

Luna HSM v7.9 introduces NIST-approved PQC algorithms, delivering real-world quantum-safe encryption validated by Thales partners for production use.

cpl.thalesgroup.com

 

 

글로벌 보안 기업 탈레스(Thales)가 양자내성암호(PQC)를 지원하는 차세대 네트워크 HSM 제품인 '루나 8(Luna 8)'을 출시했다는 소식입니다.

 

 

배경: "선탈취 후해독(HNDL)" 위협의 현실화

  • HNDL(Harvest Now, Decrypt Later): 지금 당장은 해독할 수 없는 중요한 암호화 데이터를 미리 훔쳐 쌓아두었다가, 몇 년 뒤 양자컴퓨터가 상용화되면 한꺼번에 해독해 버리는 공격 방식입니다.
  • 조사에 따르면 기업의 59%가 이미 PQC 프로토타입을 테스트 중이며, 이에 대응하기 위한 하드웨어 교체 수요가 본격화되고 있습니다.

 

루나 8(Luna 8)의 핵심 기술적 특징

  • 양자내성암호(PQC) 완벽 지원: 공개키 기반구조(PKI), 디지털 서명, 신원 관리 등 엔터프라이즈 핵심 키를 양자컴퓨터 공격으로부터 안전하게 보호합니다.
  • 연산 속도 수십 배 향상: 앞서 다루었듯 PQC는 키와 연산량이 수십 배 크지만, 새로운 전용 HSM 플랫폼 기반으로 연산 속도를 대폭 끌어올려 성능 저하 문제를 해결했습니다.
  • 하이브리드 지원 및 유연성: 기존 암호화 알고리즘(RSA/ECC)과 새로운 PQC를 동시에 지원하며, 향후 새로운 PQC 표준이나 알고리즘이 나와도 소프트웨어/펌웨어 업그레이드로 반영할 수 있는 아키텍처를 갖췄습니다.

 

펌웨어 업그레이드(v7.9) -> 차세대 신규 장비(루나 8)

  • Luna HSM v7.9 (2025년 7월 블로그):
  • 기존에 고객들이 사용 중이던 Luna 7세대 HSM 장비에 NIST 정식 PQC 표준 알고리즘(ML-KEM, ML-DSA 등)을 펌웨어(소프트웨어) 단에서 최초로 내장하고, 주요 PKI 파트너사들(DigiCert, Keyfactor 등)과 실전 검증을 마친 단계입니다.
  • 루나 8 / Luna 8 (2026년 7월 기사):
  • 펌웨어 업데이트 수준을 넘어, 수십 배 커진 PQC 연산량을 완벽히 처리할 수 있도록 하드웨어 칩과 플랫폼 자체를 완전히 새로 설계하여 출시한 차세대 PQC 전용 HSM 장비입니다.

① NIST 공식 PQC 표준의 펌웨어 '네이티브(Native)' 탑재

  • 외부 별도 모듈(FM) 없이, HSM 펌웨어 자체에 NIST 표준인 ML-KEM(FIPS 203, 키 교환용)ML-DSA(FIPS 204, 디지털 서명용) 알고리즘을 직접 내장했습니다.
  • 백업, 복구, 키 동기화 시 기존 암호+PQC 암호를 조합한 '하이브리드 PQC 암호화'를 지원합니다.

② 글로벌 PKI/디지털 신뢰 파트너사들과의 실전 검증 완료

실험실 수준이 아니라 실제 기업 환경에서 동작하는지 글로벌 파트너사들과 전면적인 합동 테스트를 진행했습니다.

  • DigiCert (디지서트): 양자 안전 TLS 인증서 발급 및 PKI 수명주기 관리 검증 완료.
  • Keyfactor, Ascertia, EVERTRUST, Garantir: 코드 서명, PKI, 신원 인증 및 자국 암호 주권 솔루션 연동 검증.

③ FIPS 140-3 Level 3 보안 인증 진행 중

  • 단순한 기술 구현을 넘어, 최고 수준의 정부/금융 보안 기준인 FIPS 140-3 Level 3 인증 절차를 진행하여 기업들이 안심하고 실제 운영(Production) 환경에 도입할 수 있는 기반을 마련했습니다.

 

기존 시스템 보호 및 호환성

  • 기존 투자 보호: 기업들이 기존에 사용하던 애플리케이션이나 인터페이스를 수정할 필요 없이 그대로 쓸 수 있도록 호환성을 제공합니다.
  • 네트워크 어플라이언스 형태: 우선은 대규모 엔터프라이즈 및 하이퍼스케일 환경에서 공유해 쓰는 독립형 네트워크 HSM 장비 형태로 먼저 출시되었습니다.

 

향후 확장 계획 (금융 결제 HSM)

  • 탈레스는 이 차세대 PQC HSM 플랫폼을 금융/결제 전용 HSM 시장의 표준인 '페이쉴드(PayShield) 11K'에도 확장 적용할 예정입니다. 이를 통해 카드 결제, PIN 번호 보호, 금융 트랜잭션 영역까지 PQC 보안을 전면 확대한다는 구상입니다.

링크: https://qwen.ai/blog?id=qwen3.8

 

Qwen Studio

 

qwen.ai

 

2026년 8월 3일 알리바바 Qwen 팀이 발표한 최신 플래그십 AI 모델인 'Qwen3.8-Max'의 공식 블로그 발표문입니다.

 

1. Qwen3.8-Max 

  • 모델 스펙:2.4조 개(2.4T) 파라미터 (MoE 구조로 연산 시 95B 활성화).
    • MoE 모델의 '95B Active' 구조는 VRAM 사용량을 줄여주는 기술이 아니라, 엄청나게 큰 모델(2.4T)을 빠른 속도(95B급 연산)로 대답하게 만드는 기술입니다.
    • 따라서 로컬 구동 시 필요한 VRAM 스펙은 여전히 2.4T 전체 무게 기준으로 준비해야 합니다.
  • 오픈소스 전환: QwenCloud API를 통해 즉시 사용 가능하며, 다음 주 Hugging Face 및 ModelScope에 가중치(Open Weights) 전면 무상 공개 예정.
    • 오픈 웨이트의 이점: 온프레미스(자체 데이터센터)나 AWS/GCP 같은 클라우드 GPU 인프라를 대여해 직접 엔드포인트를 띄울 수 있습니다. 따라서 내부 기밀 데이터가 외부로 유출될 가능성이 없습니다.
    • 모델의 가중치가 완전히 노출되어 있으므로, 특정 산업 도메인(예: 법률, 의료, 반도체 설계, 특정 기업 내부 용어)에 맞춰 가중치를 직접 수정 및 추가 학습(LoRA, QLoRA, Full Fine-tuning 등)시킬 수 있습니다.
  • 핵심 지향점: 단순 텍스트 생성을 넘어, 사람의 개입 없이 수백 단계의 피드백 루프를 거쳐 최종 결과물(Deliverable)까지 자율적으로 완성하는 에이전트 능력 극대화.

 

2. 주요 분야별 자율 수행 성과

① 자율 코딩 및 연구 (Autonomous Coding)

사람의 도움 없이 며칠 동안 스스로 코드를 실행하고, 오류를 분석하며 능동적으로 목적을 달성합니다.

  • 16일간의 자율 프로젝트 운용: oh-my-cli 프로젝트를 구축하고, 16일 동안 이슈 수집, 에이전트 할당, 코드 작성, CI 테스트 및 PR 병합까지 전 과정을 스스로 수행하여 265개 커밋을 축적.
  • 학술 논문 재현 및 자체 성능 개량: AI 데이터 선택 관련 논문을 바탕으로 125시간 동안 7,600줄의 코드를 짜고 33회 GPU 학습을 수행. 논문 성과를 복원했을 뿐만 아니라, 스스로 18가지 아이디어를 테스트하여 기존 논문 저자들의 성능을 오히려 넘어서는 새로운 기법(+2.7점)을 개발.
  • 인간과의 경쟁에서 승리: 526개 인간 팀이 참가한 데이터 분석 대회에서 24시간 제한 시간 내에 여러 모델(BERT, Qwen-VL 등)을 조합한 앙상블 시스템을 스스로 구축하여 458개 인간 팀(상위 13%)을 제침.

② 복잡한 업무 자동화 (Real-World Work)

  • 법무 검토: 200페이지가 넘는 계약 서류 더미에서 1,284개 조항을 1시간 만에 감수 (보통 법률 보조팀이 일주일간 할 분량).
  • UI/UX 디자인: 단 한 번의 대화로 8개 화면이 완전 상호작용하는 금융 앱 프로토타입 설계.
  • 건축 구조 공학: 단일 도면 이미지에서 30층 빌딩의 3D 내진 구조 모델을 웹 브라우저 상에 복원.
  • 초고도 금융 퀀트 연구: 한 줄의 요구사항으로 330개 서브 에이전트를 가동해 6,000번의 백테스트를 병렬 수행, 실전 투입 가능한 ETF 포트폴리오 전략 구축.

③ 초장기 복합 작업 (Long-Horizon Task)

[최소 입력] -> [RTL 작성/수정] -> [Iverilog 시뮬레이션] -> [Yosys 합성] -> [OpenROAD 배치·배선] -> [피드백 반영 반복]
  • 자율 반도체(Chip) 설계: 아무런 기본 코드가 없는 상태에서 약 500턴의 대화와 71번의 시뮬레이션을 거쳐 GCD/RSA 암호화 가속기 회로를 자율 설계. 게이트 수(Yosys Cell Count)를 8,298개에서 678개로 91.8% 절감하고, 실물 칩 다이(Die) 면적을 81% 축소하면서 500MHz 타임 클로저를 성공적으로 달성.
  • 365일 이커머스 쇼핑몰 운영 시뮬레이션: 10만 위안의 자본금으로 시작하는 1년 주기 쇼핑몰 운용 테스트에서, 600여 공급업체와의 다단계 협상과 사기 거래처 도려내기를 자율적으로 수행하여 4.16배의 자산 증식(41만 6천 위안)으로 경쟁 모델(GLM 5.2 등)을 제치고 1위 기록.

④ 멀티모달 시각 에이전트 (Multimodal Agents)

  • 시각적 피드백 루프: 이미지/비디오를 읽는 것에 그치지 않고, 자신이 생성 중인 결과물(웹 화면 레이아웃, 3D 객체 방향 등)을 스스로 모니터링하여 정렬이 틀렸거나 디자인이 이상하면 즉시 수정하는 자율 피드백 기능 탑재.
  • 비디오 메모리 그래프: 100시간이 넘는 영상에서 인물, 사건, 타임스탬프를 기억 그래프로 구성해 검색 및 관계 재구성 지원.

 

3. 개발 도구 및 프레임워크 연동

  • API 파라미터 지원: reasoning_effort 옵션을 통해 추론 깊이를 xhigh, medium, low로 조절 가능.
  • 기존 개발 환경 완벽 호환: Anthropic 및 OpenAI 표준 프로토콜을 모두 지원하므로, 기존 환경 변수 지정만으로 Claude Code, Codex, OpenClaw, Qoder 등 주요 코딩 에이전트 도구에서 바로 사용할 수 있습니다.

 

💡 최종 요약

Qwen3.8-Max는 OpenAI의 GPT-5.6 Sol, Anthropic의 Claude Opus 4.8 / Fable 5 등 최정상 프론티어 모델들과 겨루는 2.4조 파라미터급 대형 AI로, "며칠이 걸리는 복잡한 개발·업무·반도체 설계·금융 퀀트 연구 등을 사람 없이 스스로 완수하는 차세대 오픈소스 플래그십 AI"의 등장을 알리는 발표입니다.

 

링크: https://openai.com/index/ten-advances-in-mathematics/

 

Ten advances in mathematics and theoretical computer science

OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.

openai.com

 

OpenAI가 차세대 내부 AI 모델인 'Astra(아스트라)'를 활용해 지난 수십 년간 수학계와 이론 컴퓨터 과학계에서 풀리지 않던 난제 10가지에 대한 해답과 증명을 찾아냈다는 발표 내용입니다.

 

핵심 요약

  • 차세대 모델 'Astra'의 성과: OpenAI의 미공개 차세대 AI 모델 Astra가 최하 10년 이상(길게는 80년 이상) 정체되어 있던 수학 및 컴퓨터 과학 분야의 미제 문제 10개를 해결했습니다.
  • 극적인 가성비: 이 10가지 난제의 해답을 찾아내는 데 들어간 AI 토큰 연산 비용은 단 약 2,000달러(한화 약 270만 원 수준)에 불과했습니다.
  • 완벽한 기계 검증 (Lean 사용): AI가 해답을 제시한 후, 연구진이 증명 검증용 프로그래밍 언어인 Lean 4를 활용해 컴퓨터가 100% 오류 없음을 검증할 수 있는 증명서(Certificate)를 함께 공개했습니다.

AI가 해결한 10가지 주요 수학·컴퓨터 과학 난제

Astra가 해결한 문제들은 기하학, 암호학, 양자 복잡도, 군론 등 현대 수학과 이론 컴퓨터 과학의 핵심 분야에 걸쳐 있습니다.

  1. 고차원 구 충전 (High-dimensional sphere packing): 고차원 공간에서 구(Sphere)를 가장 밀도 있게 쌓는 한계선에 대한 새로운 상한선을 제시했습니다.
  2. 이진 및 구면 부호 (Binary and spherical codes): 정보 이론 및 통신 부호학에서 부호의 최대 크기 범위를 지수적으로 대폭 개선했습니다.
  3. 비소픽 군의 존재 증명 (Non-sofic groups): 1999년 수학자 그로모프(Gromov)가 제안한 이후 27년간 아무도 밝혀내지 못했던 '비소픽 군'이 실제로 존재함을 구체적인 구조 구축으로 증명했습니다.
  4. 콘의 경직성 추측 반증 (Connes's rigidity conjecture): 폰 노이만 대수학 분야에서 오래된 유명한 추측을 반례를 통해 반증했습니다.
  5. 산술 회로 복잡도 (Arithmetic circuit complexity): 컴퓨터 연산의 기본 한계를 다루는 분야로, 영구식(Permanent) 연산에 필요한 새로운 복잡도 하한선을 증명했습니다.
  6. 양자 병렬 반복 정리 (Quantum parallel repetition): 양자 게임 이론에서 게임을 반복할 때 성공 확률이 어떻게 감소하는지에 대한 핵심 원리를 증명했습니다.
  7. 가장 가까운 벡터 문제 (Closest vector problem): 차세대 양자내성암호(PQC)의 안전성 기반이 되는 격자(Lattice) 기하학 문제의 연산 난이도를 증명했습니다.
  8. 에르하르트 부피 추측 (Ehrhart's volume conjecture): 다면체의 무게중심과 격자점에 관한 기하학적 최대 부피 추측을 완전 해결했습니다.
  9. 다색 램지 수 (Multicolor Ramsey numbers): 전설적인 수학자 폴 에르되시(Paul Erdős)의 미제 문제 목록 중 183번 문제를 해결했습니다.
  10. 극대 그래프 추측 (Extremal number conjectures): 에르되시의 또 다른 미제 문제인 146번과 180번 문제를 해결했습니다.

OpenAI가 밝힌 학계에 대한 책임과 의미

  • 저작권과 기여 표기의 명확화: AI가 100% 도출한 증명을 인간이 만든 것처럼 거짓으로 기재해서는 안 되며, AI 시스템의 기여와 인간의 정형화(Lean) 역할을 솔직하게 명시해야 한다고 밝혔습니다.
  • 학술 연구 저변 확대: 10만 명의 연구자에게 최첨단 모델을 무상 제공하는 'ChatGPT for Academic Researchers' 프로그램처럼, AI 기술을 통해 과학자와 수학자들의 연구를 가속화하는 '동료 연구자(Collaborator)'로서 기여하겠다는 의지를 담고 있습니다.

링크: https://github.com/drumih/turbo-fieldfare

 

GitHub - drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook

Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook - drumih/turbo-fieldfare

github.com

 

2,600억(26B) 파라미터급 대형 AI 모델을 램(RAM)이 고작 8GB뿐인 일반 맥북(Apple Silicon Mac)에서 단 2GB의 메모리만 사용하여 성공적으로 구동해낸 최신 오픈소스 프로젝트 'TurboFieldfare' 입니다.

 

Gemma 4 26B-A4B

구글 딥마인드(Google DeepMind)가 공개한 오픈소스 멀티모달 AI 모델로, "지능은 260억 급으로 높이면서 연산 부담은 40억 급으로 확 줄인 가성비 최고 수준의 AI 모델"입니다.

 

  • 26B (Total Parameters = 260억 개): 모델 전체가 보유하고 있는 지식/전문가 수치(파라미터)의 총합이 260억 개라는 뜻입니다.
  • A4B (Active Parameters = 40억 개): Active 4B의 약자로, AI가 질문 하나에 답할 때 실제로 작동시키는 전문가는 단 40억 개(3.8B~4B)뿐이라는 뜻입니다.

핵심 특징

 

 

  • 압도적인 연산 효율성 (MoE의 힘)
    • 보통 260억 개급 모델을 돌리려면 엄청난 고사양 GPU와 메모리가 필요합니다.
    • 하지만 Gemma 4 26B-A4B는 실제로 40억 개 수준의 연산량만 쓰기 때문에, 앞서 소개된 TurboFieldfare 같은 스페셜 런타임을 활용하면 고작 8GB RAM을 가진 맥북(Mac) 환경에서도 2GB 메모리만 써서 로컬 구동할 수 있게 됩니다.
  • 멀티모달 (Multimodal) 지원
    • 글자(Text)뿐만 아니라 이미지(Image)와 동영상(Video)까지 직접 보고 이해할 수 있습니다.
    • 사진 속 내용을 분석하거나 시각적 데이터를 추출하는 능력이 뛰어납니다.
  • 추론(Reasoning) 및 생각 모드 (Thinking Mode)
    • 복잡한 수학 문제나 코딩 문제, 논리적 질문을 받으면 바로 답을 뱉지 않고 내부적으로 단계별 생각(Reasoning) 과정을 거쳐 수준 높은 답변을 도출합니다.
  • 방대한 대화 문맥 (256K 컨텍스트 윈도우)
    • 한 번에 읽고 기억할 수 있는 텍스트 양이 25만 6천 토큰(약 책 1~2권 분량, A4 용지 380여 장)에 달해, 긴 문서나 거대한 소스 코드를 한꺼번에 집어넣고 분석시키기에 매우 유리합니다.

 

 

MoE(Mixture of Experts)

 

  • 기존 AI (Dense Model): 모든 분야(수학, 코딩, 문학, 번역 등)를 혼자 다 공부한 '만능 해결사 1명'입니다. 질문이 들어오면 질문의 난이도나 분야에 상관없이 자기 뇌 전체(모든 파라미터)를 다 써서 생각합니다.
  • MoE AI (Sparse Model): 분야별 전문가들이 모인 '종합 컨설팅 로펌'과 같습니다.
    • 라우터 / 게이팅 네트워크 (Router / Gating Network): 입구에서 손님의 질문을 보고 어떤 전문가에게 보낼지 결정하는 '매니저'입니다.
    • 전문가들 (Experts): 수학 전담, 코딩 전담, 언어 전담 등 각 분야에 특화된 소형 신경망들입니다.
    • MoE 구조의 장점
      • 연산량(전기·비용) 대폭 절감: 전체 파라미터가 260억 개(26B)라도, 질문 하나당 선택되는 전문가는 38억 개(3.88B) 수준일 수 있습니다. 모델의 '지능(총 파라미터)'은 260억 개급이지만, 실제 질문을 처리하는 '속도와 전기 소모'는 38억 개급 모델 수준으로 가벼워집니다.
      • 온디바이스/소형 디바이스에서의 혁신: 앞서 보았던 TurboFieldfareGemma 4 같은 최신 기술들이 8GB RAM을 가진 맥북에서도 돌 수 있는 이유입니다. 전체 전문가 데이터를 RAM에 다 올리지 않고, 매니저가 지정하는 특정 전문가만 그때그때 가져와 연산하면 되기 때문입니다.

 

 

어떻게 14.3GB 모델을 2GB RAM으로 돌리나요?

원래 26B(260억 개) 파라미터 크기의 모델을 돌리려면 최소 16GB~32GB 이상의 통합 메모리가 필요합니다. 하지만 이 프로젝트는 MoE(Mixture of Experts, 전문가 혼합) 구조의 특성을 극도로 활용했습니다.

  1. 상주 메모리 (RAM에는 1.35GB만 상주):
    • 모델 전체를 RAM에 올리지 않고, 모든 토큰 연산에 공통으로 필요한 '핵심 코어(1.35GB)'와 대화 문맥(KV 캐시)만 RAM에 항상 올려둡니다.
  2. 필요한 것만 SSD에서 그때그때 스트리밍 (SSD Streaming):
    • Gemma 4 모델은 전체 26B 파라미터 중 한 번에 약 38.8억(3.88B) 개(8개의 전문가)만 활성화되어 연산합니다.
    • AI가 다음 단어를 생각할 때 필요한 특정 '전문가(Expert)' 데이터만 초고속 SSD에서 그때그때 병렬로 읽어와(pread) 연산하고 버립니다.
  3. 결과: 8GB RAM을 가진 M2 맥북 에어에서도 메모리 부족(OOM) 오류 없이 초당 5~6토큰, 성능이 좋은 M5 Pro(24GB)에서는 초당 30~35토큰의 실용적인 속도로 AI 대화를 생성할 수 있습니다.

 

특징 및 기술적 구성

 

  • 애플 실리콘 최적화 (Swift 6.2 + Metal 4):
    • C++이나 기존 프레임워크(MLX, llama.cpp)를 감싸는 형태가 아니라, 애플의 최신 그래픽/연산 API인 Metal 4 커널과 Swift 언어로 완전히 새로 구축한 전용 런타임입니다.
  • 스마트 설치 시스템 (Streaming Repack):
    • 15GB에 달하는 모델을 다운로드받을 때, 전체 용량을 압축 해제해서 디스크를 이중으로 차지하지 않도록 허깅페이스에서 받아오는 즉시 .gturbo라는 독자적인 스트리밍 포맷으로 직접 재포장(Repack)하여 저장 공간을 절약합니다.
  • 다양한 인터페이스 제공:
    • 일반 사용자를 위한 네이티브 Mac 앱(GUI)
    • 터미널 환경을 위한 CLI 도구
    • 다른 앱과 연동할 수 있는 OpenAI 호환 로컬 서버(127.0.0.1:8080)

 

실제 설치 과정

1. TurboFieldfare 설치

git clone https://github.com/drumih/turbo-fieldfare.git
cd turbo-fieldfare

swift build -c release
.build/release/TurboFieldfareMac

 

 

2. Gemma 4 다운로드

Download 선택
다운로드 완료 후 Load Model
간단한 프롬프트를 넣어 정상 작동 확인

 

3. 로컬 API 서버 실행

swift build -c release --product TurboFieldfareServer

.build/release/TurboFieldfareServer \
  --model scratch/gemma4.gturbo

 

서버가 정상적으로 실행되면 http://127.0.0.1:8080/ 에서 API를 제공합니다.

 

4. OpenCode 연결

brew install anomalyco/tap/opencode

 

프로젝트 디렉터리에 opencode.json 파일을 생성합니다.

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "turbo-fieldfare": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Local Gemma 4",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1",
        "apiKey": "local"
      },
      "models": {
        "gemma-4": {
          "name": "Gemma 4 26B-A4B"
        }
      }
    }
  },
  "model": "turbo-fieldfare/gemma-4"
}

 

5. 실행

실제 프로젝트 폴더에서 실행합니다.

cd ~/Desktop/Myproject
opencode

+ Recent posts