metal : optimize FA kernels (#10171)

* ggml : add ggml_flash_attn_ext_get_prec * metal : use F16 precision in FA kernels ggml-ci * metal : minor clean-up * metal : compile-guard bf16 FA kernels ggml-ci * build : remove obsolete compile flag [no ci] * metal : prevent int overflows [no ci] * cuda : disable BF16 FA ggml-ci * metal : fix BF16 requirement for FA kernels ggml-ci * make : clean-up [no ci]
2024-11-08 13:47:22 +02:00 · 2024-11-08 13:47:22 +02:00 · 841f27abdb
commit 841f27abdb
parent d05b3127bd
8 changed files with 498 additions and 339 deletions
--- a/ggml/include/ggml.h
+++ b/ggml/include/ggml.h
@ -1746,6 +1746,9 @@ extern "C" {
            struct ggml_tensor * a,
            enum ggml_prec       prec);

+    GGML_API enum ggml_prec ggml_flash_attn_ext_get_prec(
+            const struct ggml_tensor * a);
+
    // TODO: needs to be adapted to ggml_flash_attn_ext
    GGML_API struct ggml_tensor * ggml_flash_attn_back(
           struct ggml_context * ctx,