yuuki-net/FreeToken-Kai
Unofficial FreeToken fork: on one RTX 3060 12 GB, a 35B MoE at 250k of context or gpt-oss-120b; Flash-Next 125B on two. Half the RAM, image input. Runs on Turing: RTX 2060, RTX 20 series, sm_75.
GitHub repository with 5 stars and 1 forks.
Language: Python
Topics: freetoken, llm-inference, moe, qwen3, speculative-decoding, rtx-2060, nvidia-turing, gpt-oss, consumer-gpu, gpt-oss-120b