연구
앞 절은 제가 쓴 논문입니다. 그 아래는 이 작업의 바탕이 되는 참고문헌으로, 각 항목은 초록 요약이 아니라 이 사이트에서 그 연구가 맡은 역할입니다.
논문
ORCID- 2026.9 · 이장훈 · arXiv:2609.18672
Selection Is Retrieval, Abstention Is Not: On-Device Tool Routing over 70 Korean-English Actions
온디바이스에서 한국어·영어 70개 액션을 두고, 맞는 도구를 고르는 일은 검색처럼 움직이지만 아무 도구도 부르지 않기로 하는 기권은 그렇지 않아, 둘을 따로 다뤄야 함을 측정했습니다.
- 2026.9 · 이장훈 · arXiv:2609.06129
Protocol Compression Changes Which Party Pays: Bilateral Cost in Cross-Organization LLM Agent Communication
조직 간 LLM 에이전트 통신에서 프로토콜을 압축해도 총비용은 줄지 않고 어느 쪽이 부담하는지가 바뀐다는 점을, 주고받는 양쪽에서 측정했습니다.
- 2026.8 · 이장훈 · arXiv:2608.23023
Most of the LLM Routing Gap Is Task Type: A Task-Type and Language Decomposition over a Fully Executed 14×294 Matrix, and the Reproducibility Floor It Has to Clear
14개 모델과 294개 질의를 7개 작업 유형, 3개 언어로 전수 실행해 재현 가능한 라우팅 격차의 대부분이 작업 유형에서 설명되고, 언어가 추가로 회수하는 몫은 작다는 점을 측정했습니다.
- 2026.8 · 이장훈 · arXiv:2608.13959
Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention
제약된 도구 호출에서 어휘 마스킹과 종료 조건의 효과를 분리하고, 제약이 모델의 기권 판단을 개선하기보다 읽을 수 없는 출력을 고치는 경우가 많음을 측정했습니다.
참고문헌
- 2017 · Vaswani et al.
Attention Is All You Need
Transformer를 처음 제시한 논문입니다. 지금의 LLM·생성 스택이 서 있는 attention의 출발점입니다.
- 2019 · Radford et al.
GPT-2
다음 토큰만 크게 학습해도 여러 작업으로 옮겨 간다는 점을 보여 줍니다. “한 번 학습하고 프롬프트로 맞춘다”는 방식의 원형입니다.
- 2020 · Kaplan et al.
Scaling Laws
손실·연산량·데이터·파라미터가 예측 가능하게 움직입니다. 감이 아니라 예산 배분이 이기는 이유입니다.
- 2020 · Ho, Jain, Abbeel
DDPM
디노이징 diffusion을 쓸 만한 생성 과정으로 만들었습니다. 이미지(그리고 이후 비디오) diffusion의 바탕입니다.
- 2021 · Radford et al.
CLIP
이미지와 텍스트를 대비 학습으로 한 공간에 넣습니다. 텍스트 조건과 정렬 점수가 여기서 나옵니다.
- 2022 · Rombach et al.
Latent Diffusion
압축 latent에서 diffusion을 돌려 고해상도를 싸게 만듭니다. Stable Diffusion 계열의 조상인데, 자연어 프롬프트 해부학은 저희가 시험해 본 뒤 버린 쪽입니다.
- 2022 · Ho et al.
Video Diffusion
diffusion을 비디오로 확장합니다. 시간에 걸친 디노이징 틀을 세웠고, 이후 프론티어 규모로 제품화되었습니다.
- 2022 · Défossez et al.
EnCodec
음성을 이산 토큰으로 만드는 신경 코덱입니다. 파형에서 언어모델식 생성으로 가는 다리입니다.
- 2022 · Peebles, Xie
DiT
U-Net 대신 latent 패치 위 transformer로 diffusion합니다. 프론티어 이미지·ACE Step DiT 계열입니다.
- 2023 · Lipman et al.
Flow Matching
벡터장을 회귀해 continuous normalizing flow를 학습합니다. diffusion식 생성의 더 깔끔한 대안 경로입니다.
- 2023 · Chen, Zaharia, Zou
FrugalGPT
프롬프트 적응·근사·캐스케이드로 API 비용을 줄입니다. Eval·Console이 받는 싼 모델 대 강한 모델 라우팅의 초기 틀입니다.
- 2024 · Ong et al.
RouteLLM
선호도 데이터로 라우터를 학습해 쉬운 질문은 약한 모델, 어려운 질문은 강한 모델로 보냅니다. Eval에서 라벨 일치가 약 25%에 그쳐 라우팅을 접기 전에 써 본 틀입니다.
- 2024 · BerriAI
LiteLLM
여러 제공사를 묶는 LLM 게이트웨이·라우팅 도구입니다. Eval 라우팅이 실패했을 때 함께 돌려 본 스택 중 하나입니다.
- 2024 · Sadat et al.
APG
CFG 과포화를 guidance 투영으로 고칩니다. Tune Pro가 KSampler에서 평범한 DiT CFG 대신 APG를 쓰는 이유입니다.
- 2024 · Du et al.
CosyVoice 2
낮은 지연 스트리밍 TTS와 강한 제로샷 보이스 클로닝을 갖춥니다. Redrob Speech 쪽 음성 모델의 기준점입니다.
- 2025 · Black Forest Labs et al.
FLUX.1 Kontext
Black Forest Labs의 flow-matching 생성·편집입니다. 타이포 때문에 버린 FLUX.2 [klein] 4B 포토리얼 후보의 계보입니다.
- 2025 · Agrawal et al.
GEPA
Genetic-Pareto 반성형 프롬프트 진화입니다. Eval이 IN22-Gen·IndicGLUE·GSM8K 이중 평가 전에 싼 경로를 다듬는 방식입니다.
- 2025 · Wu et al.
Qwen-Image
텍스트 렌더와 네이티브 편집이 강한 이미지 파운데이션입니다. Redrob Image의 무거운 경로로, 커스텀 체크포인트와 편집 우선 제품에 씁니다.
- 2025 · Tongyi-MAI / Z-Image Team
Z-Image
효율적인 단일 스트림 DiT입니다. Z-Image-Turbo는 8스텝 증류판으로, Redrob Image의 빠르고 쉬운 요청용 경로입니다.
- 2026 · Sarvam AI
Sarvam
Indic 중심 오픈 언어 모델(30B/105B, 이전 Sarvam-1/M)입니다. Console의 라우팅 Indic 텍스트 스택이 쓰는 오픈 백엔드 계열입니다.
- 2026 · Gong et al.
ACE-Step 1.5
오픈 음악 파운데이션입니다. LM 플래너와 DiT, 로컬 추론, LoRA를 쓰고, Tune Fast/Pro 뒤의 가중치·Comfy 그래프입니다.