Kimi K3 실측: 시맨틱 검색 추가로 토큰 소비 27% 절감
글쓴이: 王舒虹 (Zilliz)
핵심 결과
Kimi K3에 claude-context MCP를 결합하여 대규모 코드베이스에서의 검색 성능을 실측했습니다. 핵심 지표는 다음과 같습니다:
- 토큰 소비: 125,147 → 91,174 토큰 (-27.1% 절감)
- 도구 호출 횟수: 4.2회 → 1.9회 (-55% 감소)
- F1 점수: 0.844 → 0.946 (+12.1% 향상)
💡 핵심 인사이트: 시맨틱 검색 경로를 단축하면 토큰을 절약할 수 있습니다. 코드베이스가 클수록 그 효과가 뚜렷합니다.
벤치마크: Django 코드베이스에서의 Kimi K3 테스트
Django 코드베이스를 대상으로 4가지 과제를 수행하며 Kimi K3의 기본 성능을 측정했습니다:
- year_bounds_between – 연도 범위 계산 함수
- iso_year_lookup – ISO 연도 조회 로직
- select_for_update – 데이터베이스 잠금 쿼리
- datetime_year_bounds_timezone – 타임존 포함 연도 범위 처리
순수 Kimi K3의 평균 성능:
| 지표 | 평균값 |
|---|---|
| 토큰 소비 | 125,147 토큰 |
| 도구 호출 횟수 | 4.2회 |
| F1 점수 | 0.844 |
대규모 코드베이스에서 Kimi K3가 파일을 탐색하는 과정에서 상당한 토큰을 소비하는 것을 확인했습니다. 특히 여러 디렉토리를 순회하며 관련 파일을 찾는 과정이 비효율적이었습니다.
claude-context MCP를 활용한 최적화
claude-context MCP를 추가하여 시맨틱 코드 검색 기능을 부여했습니다. 이는 Milvus/Zilliz 벡터 데이터베이스를 활용하여 코드베이스를 인덱싱하고, 관련 코드 조각을 의미적으로 검색할 수 있게 합니다.
통제 변수
| 항목 | 값 |
|---|---|
| 모델 | Kimi K3 |
| 코드베이스 | Django (main 브랜치) |
| 벡터 DB | Milvus / Zilliz Cloud |
| 임베딩 | voyage-code-3 |
| 청크 크기 | 512 토큰 |
결과 비교
| 과제 | K3 전용 (토큰) | K3 + claude-context (토큰) | 절감율 |
|---|---|---|---|
| year_bounds_between | 112,458 | 95,213 | -15.3% |
| iso_year_lookup | 108,792 | 89,467 | -17.8% |
| select_for_update | 135,653 | 110,641 | -18.4% |
| datetime_year_bounds_timezone | 143,684 | 59,375 | -58.7% |
⚠️ 최악의 경우 분석:
datetime_year_bounds_timezone 과제에서 143,684 → 59,375 토큰으로 -58.7%의 절감을 달성했습니다. 타임존 관련 코드가 여러 모듈에 분산되어 있어 시맨틱 검색의 효과가 가장 컸습니다.
설정 가이드 (3단계)
1단계: Milvus/Zilliz 환경 설정
.env 파일에 벡터 데이터베이스 접속 정보를 설정합니다:
# .env 파일
MILVUS_URI=https://your-zilliz-cloud-endpoint
MILVUS_TOKEN=your-api-key
2단계: MCP 설정 파일 생성
.kimi-code/mcp.json 파일을 프로젝트 루트에 생성합니다:
{
"mcpServers": {
"claude-context": {
"command": "npx",
"args": ["claude-context-mcp"],
"env": {
"MILVUS_URI": "${MILVUS_URI}",
"MILVUS_TOKEN": "${MILVUS_TOKEN}"
}
}
}
}
3단계: Kimi CLI로 코드 인덱싱
Kimi CLI를 실행하여 코드베이스를 벡터 데이터베이스에 인덱싱합니다:
# 코드 인덱싱 실행
kimi index --path ./your-project
# 인덱싱 상태 확인
kimi index status
결론
소규모 함수 중심 프로젝트: 순수 Kimi Code만으로 충분합니다. claude-context의 오버헤드가 오히려 불필요할 수 있습니다.
대규모 레포지토리: claude-context를 시도해볼 가치가 충분합니다. 특히 여러 모듈에 걸쳐 분산된 코드를 추적해야 할 때 효과적입니다.
💡 핵심 통찰: 검색 경로를 단축하여 토큰을 절약할 수 있습니다. 시맨틱 검색은 모델이 직접 파일을 순회하는 대신, 벡터 유사도를 통해 가장 관련성 높은 코드 조각으로 즉시 접근하게 합니다.
참고 자료
검증 완료: 2026-07-22