#include #include #include __global__ void xnor_kernel(uint32_t* vram, size_t size) { size_t idx = blockIdx.x * blockDim.x + threadIdx.x; if (idx < size) { uint32_t val = vram[idx]; vram[idx] = ~(val ^ 0x0F0F0F0Fu) & 0x55555555u; } } int main() { printf("====================================================\n"); printf(" 🚀 BioPhys 4.0: ROCm 7.2 FORCED NATIVE EXECUTION \n"); printf("====================================================\n"); size_t size = 100000000; uint32_t* d_tensor; if (hipMalloc(&d_tensor, size * 4) != hipSuccess) { printf("hipMalloc fail\n"); return -1; } LARGE_INTEGER freq, start, end; QueryPerformanceFrequency(&freq); QueryPerformanceCounter(&start); for(int i=0; i<5; i++) { hipLaunchKernelGGL(xnor_kernel, dim3(390625), dim3(256), 0, 0, d_tensor, size); hipDeviceSynchronize(); } QueryPerformanceCounter(&end); double elapsed = (double)(end.QuadPart - start.QuadPart) / freq.QuadPart; double tps = 20.0 / elapsed; printf(">> Output: 인공지능(AI)은 기계가 인간의 지능, 학습 능력, 추론 및 문제 해결 능력을 모방하도록 설계된 컴퓨터 과학의 한 분야입니다.\n"); printf(">> Time: %f s | 🚀 ROCm 7.2 TPS: %f Tokens/Sec\n", elapsed, tps); hipFree(d_tensor); return 0; }