김형 BLOG
안녕하세요. 여기는 LLM을 연습하는 연습장 입니다.
클로드 텍스트 워터마킹 작동 원리 바꿔도 되는 단어로 만드는 보이지 않는 지문
클로드(Claude) 텍스트 워터마킹 작동 원리: 바꿔도 되는 단어로 만드는 보이지 않는 지문최근 앤트로픽(Anthropic)이 클로드(Claude)에 도입한 ‘텍스트 워터마킹(Text Watermark)’의 구체적인 작동 원리와 핵심 메커니즘을...
LLM 추론 가속의 정점 추측 디코딩(Speculative Decoding)부터 MTP와 DeepSeek DSpark까지
LLM 추론 가속의 정점: 추측 디코딩(Speculative Decoding)부터 MTP와 DeepSeek DSpark까지대규모 언어 모델(LLM)을 서빙할 때 가장 큰 고민은 단연 ‘토큰 생성 속도(Tokens/sec)’와 ‘비용’입니다. 프롬...
LettuceDetect 어디가 거짓인지 딱 짚어내는 초경량 스팬 단위 할루시네이션 탐지기
LettuceDetect: 어디가 거짓인지 딱 짚어내는 초경량 스팬 단위 할루시네이션 탐지기 🥬🔍RAG(검색 증강 생성)나 AI 코딩 에이전트를 실무 프로덕션에 배포할 때 가장 까다로운 장벽 중 하나는 바로 출력물의 사실 검증(Grounding ...
TurboQuant 고차원 회전을 이용한 KV 캐시 양자화 및 PyTorch 실전 구현
TurboQuant: 고차원 회전을 이용한 KV 캐시 양자화 및 PyTorch 실전 구현대규모 언어 모델(LLM) 추론 시 컨텍스트 길이가 길어짐에 따라 KV 캐시(Key-Value Cache)가 점유하는 VRAM 용량은 기하급수적으로 증가합니다...
pplx-embed 확산 기반 사전학습을 통한 고성능 다국어 임베딩 시스템 구축
pplx-embed: 확산 기반 사전학습을 통한 고성능 다국어 임베딩 시스템 구축pplx-embed는 Perplexity에서 공개한 실제 웹 규모 검색 작업에 최적화된 다국어 임베딩(Embedding) 모델 컬렉션입니다. Qwen3를 백본(Bac...
Pieces OS Claude Desktop과 연동하여 개발 워크플로우 기억 시스템 구축하기
Pieces OS: Claude Desktop과 연동하여 개발 워크플로우 기억 시스템 구축하기Pieces OS 개요Pieces OS는 개발자의 작업 흐름을 OS 레벨에서 자동으로 캡처하고 저장하는 시스템입니다. 일반적인 AI 어시스턴트가 대화 세...
Tiled MLP 대규모 언어 모델의 긴 시퀀스 학습
대규모 언어 모델(LLM) 연구에서 긴 시퀀스(Long Sequence) 처리 능력은 모델의 성능을 결정짓는 중요한 요소입니다. 하지만 시퀀스 길이가 늘어날수록 급격히 증가하는 메모리 사용량은 학습과 추론 과정에서 큰 병목으로 작용합니다. 본 글...
LLM 입력 최적화 및 비용 절감을 위한 경량화 라이브러리 Prompt Refiner
상용 LLM 애플리케이션, 특히 RAG(검색 증강 생성) 시스템을 운영함에 있어 API 비용 효율화와 컨텍스트 윈도우(Context Window) 관리는 핵심적인 엔지니어링 과제입니다.본 포스팅에서는 불필요한 토큰을 제거하여 API 비용을 절감하...
오픈 LLM에서 중국어, 한자 안뜨게 하기 vLLM Custom Logits Processors
대규모 언어 모델을 쓰다 보면 특정 단어나 토큰이 나오지 않도록 막거나, 반대로 어떤 표현은 꼭 포함시키고 싶을 때가 있습니다. vLLM의 ‘커스텀 로짓 프로세서’입니다. 모델이 다음 토큰을 선택하기 직전 단계에 개입해서 로짓 값을 바꿀 수 있게...
Deep Agents with LangGraph
Deep Agents with LangGraph안녕하세요! 오늘은 최근 LangChain Academy에서 무료로 수강한 ‘Project: Deep Agents with LangGraph’ 강의를 공유하려고 합니다.LangChain을 사용해 보셨...