SkillsAdd
Discover
Catalog
Topics
Official
Audits
Compare
Docs
Search skills
/
Discover
Catalog
Topics
Official
Audits
Compare
Docs
About
Discover
/
nvidia/tensorrt-llm
Source
nvidia/tensorrt-llm
7 skills · 103 combined installs
Skills from this source
#
Skill
Source
8W Activity
Installs
1
perf-nsight-compute-analysis
Analyze ncu (NVIDIA Nsight Compute) profiling output: SOL% bottleneck classification, roofline analysis, occupancy di…
nvidia/tensorrt-llm
25
2
kernel-triton-writing
ONLY for OpenAI Triton (@triton.jit) kernel development. NEVER use for CUDA C++ kernels, TileIR, or profiling tools (…
nvidia/tensorrt-llm
19
3
perf-optimization
Performance optimization coordination playbook. Contains specialist routing table, TileIR two-step pipeline, kernel g…
nvidia/tensorrt-llm
17
4
perf-torch-cuda-graphs
Apply CUDA Graphs to PyTorch workloads — API selection (torch.compile, PyTorch make_graphed_callables, TE make_graphe…
nvidia/tensorrt-llm
13
5
perf-torch-sync-free
>- Identify and eliminate host-device synchronizations in PyTorch code. Detects sync points (.item(), .cpu(), boolean…
nvidia/tensorrt-llm
12
6
perf-workload-profiling
Code instrumentation for timing workloads. Two scenarios: (1) Training loop — inject manual timing to report per-iter…
nvidia/tensorrt-llm
11
7
kernel-tileir-optimization
Optimize existing Triton kernels for NVIDIA TileIR backend on Blackwell GPUs (sm_100+). Adds TileIR-specific autotune…
nvidia/tensorrt-llm
6
Clear
Compare