GX10에 로컬 LLM 서빙하고 Tailscale로 외부 접속 가능한지 확인해봤다
GX10에 로컬 LLM을 24시간 구동하고 Tailscale으로 외부에서 접근할 수 있는지 확인한 기록. Open WebUI와 간단한 테스트 페이지를 모바일 LTE에서도 접속하는 테스트 흐름과, 24시간 서버에 붙일 수 있는 다양한 서비스 방향을 정리했다.
총 5개의 글
GX10에 로컬 LLM을 24시간 구동하고 Tailscale으로 외부에서 접근할 수 있는지 확인한 기록. Open WebUI와 간단한 테스트 페이지를 모바일 LTE에서도 접속하는 테스트 흐름과, 24시간 서버에 붙일 수 있는 다양한 서비스 방향을 정리했다.
DGX Spark에서 Qwen3.6 35B(MoE)와 27B(dense)를 같은 프롬프트로 비교. 27B 대비 2.5배 빠른 35B(MoE)의 속도 우위와 27B(dense)의 코드 완성도 격차를 정리하고, GPT-5.4-mini xhigh와 속도·밀도·심미성 5개 항목으로 비교했다.
GX10(DGX spark OEM)과 Ubuntu 메인 PC를 NFSv4.1로 묶어 내부망 공유폴더를 만든 기록. 서버/클라이언트 설정, fstab 자동 마운트, 실제 벤치마크와 사용 경험을 정리했다.
ASUS Ascent GX10(550만원, 128GB RAM)을 4개월간 vLLM 로컬 LLM 서버로 운용한 실제 사용기. 35B MoE 모델 45tok/s 디코딩, Mac mini 대체 고려 과정, ARM64/CUDA 13 호환성 문제 해결, NGC→spark-vllm-docker→nightly-aarch64 진화 경로, 전력·발열·소음·월 전기세(3천원 이하)까지 128GB unified memory 기반 로컬 AI 머신 구매·설계·운영의 전체 기록.
Anthropic API 구독 없이 내 로컬 vLLM/LM Studio 서버에 Claude Code를 연결하는 설정 가이드. ANTHROPIC_BASE_URL 한 줄 변경으로 무료 코드 에이전트 활용, vLLM 0.23.0+ system role 지원, LiteLLM/OpenAI 호환 API 프록시, Claude Code 2.1.154+ 버전 요구사항, Docker 환경 설정, 실제 동작 asciinema 데모 포함.