Run Ornith, Qwen, Nemotron & DeepSeek optimized on AMD Strix Halo — unified OpenAI-compatible server with tuned ROCmFP4 quants, validated 262K context, vision support & hot-swap model zoo (iGPU + NPU)
vulkan moe quantization lemonade rocm multimodal model-server fastapi openai-api llama-cpp local-llm llm-inference gguf speculative-decoding fp4 strix-halo amd-ryzen-ai ornith halofpx
-
Updated
Aug 21, 2026 - Python