#ifndef LLVM_LIBC_UTILS_GPU_TIMING_NVPTX
#define LLVM_LIBC_UTILS_GPU_TIMING_NVPTX
#include "hdr/stdint_proxy.h"
#include "src/__support/CPP/algorithm.h"
#include "src/__support/CPP/array.h"
#include "src/__support/CPP/atomic.h"
#include "src/__support/GPU/utils.h"
#include "src/__support/macros/attributes.h"
#include "src/__support/macros/config.h"
namespace LIBC_NAMESPACE_DECL {
[[gnu::noinline]] static uint64_t overhead() {
volatile uint32_t x = 1;
uint32_t y = x;
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
uint32_t result = y;
asm("or.b32 %[v_reg], %[v_reg], 0;" ::[v_reg] "r"(result));
uint64_t stop = gpu::processor_clock();
volatile auto storage = result;
return stop - start;
}
template <typename F, typename T>
[[gnu::noinline]] static LIBC_INLINE uint64_t latency(F f, T t) {
volatile T storage = t;
T arg = storage;
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
auto result = f(arg);
asm("or.b32 %[v_reg], %[v_reg], 0;" ::[v_reg] "r"(result));
uint64_t stop = gpu::processor_clock();
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
asm("" ::"r"(stop));
volatile auto output = result;
return stop - start;
}
template <typename F, typename T1, typename T2>
static LIBC_INLINE uint64_t latency(F f, T1 t1, T2 t2) {
volatile T1 storage = t1;
volatile T2 storage2 = t2;
T1 arg = storage;
T2 arg2 = storage2;
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
auto result = f(arg, arg2);
asm("or.b32 %[v_reg], %[v_reg], 0;" ::[v_reg] "r"(result));
uint64_t stop = gpu::processor_clock();
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
asm("" ::"r"(stop));
volatile auto output = result;
return stop - start;
}
template <typename T, size_t N>
static LIBC_INLINE uint64_t
throughput_baseline(const cpp::array<T, N> &inputs) {
asm("" ::"r"(&inputs));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
T result{};
#pragma clang loop unroll(disable)
for (auto input : inputs) {
asm("" ::"r"(input));
result = input;
asm("" ::"r"(result));
}
uint64_t stop = gpu::processor_clock();
asm("" ::"r"(stop));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
volatile auto output = result;
return stop - start;
}
template <typename F, typename T, size_t N>
static LIBC_INLINE uint64_t throughput(F f, const cpp::array<T, N> &inputs) {
uint64_t baseline = UINT64_MAX;
for (int i = 0; i < 5; ++i)
baseline = cpp::min(baseline, throughput_baseline<T, N>(inputs));
asm("" ::"r"(&inputs));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
T result{};
#pragma clang loop unroll(disable)
for (auto input : inputs) {
asm("" ::"r"(input));
result = f(input);
asm("" ::"r"(result));
}
uint64_t stop = gpu::processor_clock();
asm("" ::"r"(stop));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
volatile auto output = result;
const uint64_t measured = stop - start;
return measured > baseline ? (measured - baseline) : 0;
}
template <typename T, size_t N>
static LIBC_INLINE uint64_t throughput_baseline(
const cpp::array<T, N> &inputs1, const cpp::array<T, N> &inputs2) {
asm("" ::"r"(&inputs1), "r"(&inputs2));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
T result{};
#pragma clang loop unroll(disable)
for (size_t i = 0; i < N; i++) {
T x = inputs1[i];
T y = inputs2[i];
asm("" ::"r"(x), "r"(y));
result = x;
asm("" ::"r"(result));
}
uint64_t stop = gpu::processor_clock();
asm("" ::"r"(stop));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
volatile auto output = result;
return stop - start;
}
template <typename F, typename T, size_t N>
static LIBC_INLINE uint64_t throughput(F f, const cpp::array<T, N> &inputs1,
const cpp::array<T, N> &inputs2) {
uint64_t baseline = UINT64_MAX;
for (int i = 0; i < 5; ++i)
baseline = cpp::min(baseline, throughput_baseline<T, N>(inputs1, inputs2));
asm("" ::"r"(&inputs1), "r"(&inputs2));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
uint64_t start = gpu::processor_clock();
asm("" ::"llr"(start));
T result{};
#pragma clang loop unroll(disable)
for (size_t i = 0; i < N; i++) {
T x = inputs1[i];
T y = inputs2[i];
asm("" ::"r"(x), "r"(y));
result = f(x, y);
asm("" ::"r"(result));
}
uint64_t stop = gpu::processor_clock();
asm("" ::"r"(stop));
cpp::atomic_thread_fence(cpp::MemoryOrder::ACQ_REL);
volatile auto output = result;
const uint64_t measured = stop - start;
return measured > baseline ? (measured - baseline) : 0;
}
}
#endif