En gjennomgang av DeepSeek-V4.1 Flash viser at modellen oppnår svært høy hastighet, nær 420 tokens per sekund, takket være avanserte teknikker for komprimering av KV-cache.

Kilde: https://zartbot.github.io/blog/model_arch/dsv41flash_arch/en.html