leonardHONG and GitHub
f6f12e43fa
CUDA: tighter MMQ src1 buffer size for native fp4 ( #25613 )
2026-07-15 23:21:22 +08:00
leonardHONG and GitHub
2f18fe13c5
CUDA: add cublasSgemmBatched mapping for HIP/MUSA vendor headers ( #25033 )
2026-06-26 11:42:56 +02:00
leonardHONG and GitHub
f818065d75
CUDA: batch out_prod broadcast (dps2>1) path with cublasSgemmBatched ( #24426 )
2026-06-26 08:51:25 +03:00
leonardHONG and GitHub
3686e9d643
CUDA: only support F32/F16 for GGML_OP_REPEAT ( #24533 )
2026-06-15 09:11:00 +03:00
leonardHONG and GitHub
05ff59cb57
CUDA: batch out_prod inner loop with cublasSgemmStridedBatched ( #22651 )
...
* CUDA: batch out_prod inner loop with cublasSgemmStridedBatched
* CUDA: batch out_prod inner loop with cublasSgemmStridedBatched
* CUDA: add cublasSgemmStridedBatched mapping for HIP and MUSA backends
2026-05-07 21:59:29 +02:00
leonardHONG and GitHub
e77056f9b2
CUDA: use fastdiv for batch index split in get_rows ( #22650 )
2026-05-04 16:24:05 +02:00
leonardHONG and GitHub
97895129e5
ggml-cuda: flush legacy pool on OOM and retry ( #22155 )
...
* ggml-cuda: flush legacy pool on OOM and retry
Signed-off-by: 梁厚宏 <2695316095@qq.com >
* Address review comments: add explicit sync, update destructor, clean up MUSA macros
Signed-off-by: 梁厚宏 <2695316095@qq.com >
---------
Signed-off-by: 梁厚宏 <2695316095@qq.com >
2026-04-20 23:30:38 +02:00