///
No desenvolvimento de aplicações com CUDA, uma das estratégias recomendadas para a otimização de desempenho é a minimização do uso da memória compartilhada do dispositivo, priorizando-se o acesso direto à memória global, já que esta possui maior largura de banda e menor latência.