BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//Allsikt//Article Deadline//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
BEGIN:VEVENT
UID:b5f14ae34e00223618b86a4d7752f49e9397f798@allsikt.tech
DTSTAMP:20260728T192608Z
DTSTART;VALUE=DATE:20260728
DTEND;VALUE=DATE:20260729
SUMMARY:DeepSeek-V4-Flash MTP Self-Speculation Boosts Decode Speed on RTX 6000 Max-Q
DESCRIPTION:Patch vLLM to restore MTP head in DeepSeek-V4-Flash quant\; run on 2x RTX 6000 Max-Q with --disable-custom-all-reduce and NCCL tuning for optimal speed.\n\nSource: Reddit r/LocalLLaMA\nOpen: https://www.allsikt.se/article/deepseek-v4-flash-mtp-self-speculation-boosts-decode-speed-on-rtx-6000-max-q-bfb662e2
URL:https://www.allsikt.se/article/deepseek-v4-flash-mtp-self-speculation-boosts-decode-speed-on-rtx-6000-max-q-bfb662e2
STATUS:CONFIRMED
TRANSP:TRANSPARENT
END:VEVENT
END:VCALENDAR
