기타 Hacker News · 2026-09-25

글자 생성 기다릴 필요 없이 8ms 만에 판별 끝내는 로컬 AI 툴 'Ollaya' 등장

핵심 요약
  • 글자를 생성하는 대신 단 한 번의 연산으로 분류·판단을 8ms 내외로 처리하는 로컬 의사결정 모델 러너 'Ollaya'가 등장했습니다.
  • 외부 API 비용이나 데이터 유출 걱정 없이 개인 GPU에서 극도로 빠른 속도로 티켓 분류나 감정 분석을 수행할 수 있습니다.
  • 기존 TypeSafe API와 규격이 완벽 호환되며 macOS, 윈도우, 리눅스, 도커 환경을 지원합니다.
요약 Ollaya는 거대 언어 모델(LLM)을 로컬에서 쉽게 구동하게 해주는 'Ollama'의 개념을 의사결정 모델(Decision Models)에 적용한 오픈소스 도구입니다. 기존 생성형 LLM이 한 토큰씩 글을 생성하느라 수 초가 걸리는 것과 달리, 의사결정 모델은 단 한 번의 순전파(Single forward pass)로 텍스트나 JSON 데이터를 분석해 분류 및 의사결정 답변을 도출합니다. RTX 4090 환경에서 Laya 모델을 구동할 경우, 5개 질문에 대한 답변 처리가 HTTP API 통신을 포함해 약 8~10ms 수준의 극단적인 속도로 완료됩니다. 이는 네트워크 지연이 포함된 호스팅 API 서비스(TypeSafe Jev 기준 236~276ms)와 비교했을 때 자릿수가 다른 처리 속도입니다. 또한 TypeSafe의 API 규격(/v1/systemone 및 /v1/models)과 호환되어 기존 공식 파이썬 SDK(0.7.1) 설정을 로컬 서버 주소로 변경하기만 하면 코드 수정 없이 바로 대체할 수 있습니다. 지원하는 오픈 가중치 모델로는 영문 및 100개 이상 다국어를 지원하는 Convai Innovations의 Laya(322M/421M), Qwen3.5 기반의 Decider(0.75B/1.9B), 제로샷 분류기 nli 및 gliclass 등이 포함되어 있습니다. 모든 가중치는 Hugging Face 저장소에서 직접 검증 후 내려받으며, ONNX Runtime 기반으로 로컬 CPU 및 엔비디아 GPU(CUDA 13)에서 동작합니다. 고객 문의나 내부 이메일처럼 민감한 개인정보를 외부 API로 전송하지 않고 로컬 하드웨어에서 토큰 과금 없이 즉시 처리할 수 있다는 점이 핵심입니다. macOS, Windows, Linux, Docker 환경을 모두 지원합니다.
Sponsored · 광고