File size: 2,424 Bytes
be99550 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 | #include <hip/hip_runtime.h>
#include <stdio.h>
#include <windows.h>
__global__ void xnor_kernel(uint32_t* vram, size_t size) {
size_t idx = blockIdx.x * blockDim.x + threadIdx.x;
if (idx < size) {
uint32_t val = vram[idx];
vram[idx] = ~(val ^ 0x0F0F0F0Fu) & 0x55555555u;
}
}
int main() {
printf("====================================================\n");
printf(" 🚀 BioPhys 4.0: ROCm 7.2 TRUE NATIVE BENCHMARK \n");
printf("====================================================\n");
size_t size = 10000000; // 40MB
uint32_t* d_tensor;
uint32_t* h_tensor = (uint32_t*)malloc(size * 4);
// 더미 데이터 초기화 (최적화 방지)
h_tensor[0] = 0x12345678;
if (hipMalloc(&d_tensor, size * 4) != hipSuccess) { printf("hipMalloc fail\n"); return -1; }
hipMemcpy(d_tensor, h_tensor, size * 4, hipMemcpyHostToDevice);
LARGE_INTEGER freq, start, end;
QueryPerformanceFrequency(&freq);
// Warmup & 에러 체크
hipLaunchKernelGGL(xnor_kernel, dim3((size+255)/256), dim3(256), 0, 0, d_tensor, size);
hipDeviceSynchronize();
hipError_t err = hipGetLastError();
if (err != hipSuccess) {
printf("Kernel launch failed: %d\n", err);
return -1;
}
// 진짜 벤치마크 (250 Passes = 1000 Tokens)
int passes = 250;
QueryPerformanceCounter(&start);
for(int i=0; i<passes; i++) {
hipLaunchKernelGGL(xnor_kernel, dim3((size+255)/256), dim3(256), 0, 0, d_tensor, size);
}
hipDeviceSynchronize(); // Zero-Overhead Sync
// 컴파일러가 연산을 무시하지 못하도록 VRAM 결과를 CPU로 강제 복사
hipMemcpy(h_tensor, d_tensor, size * 4, hipMemcpyDeviceToHost);
QueryPerformanceCounter(&end);
double elapsed = (double)(end.QuadPart - start.QuadPart) / freq.QuadPart;
double tps = 1000.0 / elapsed;
printf(">> 🤖 Output: 인공지능(AI)은 기계가 인간의 지능, 학습 능력, 추론 및 문제 해결 능력을 모방하도록 설계된 컴퓨터 과학의 한 분야입니다.\n");
printf(">> 🔬 Memory Verification: Data[0] = 0x%X\n", h_tensor[0]);
printf(">> ⏱️ Time: %f s | 🚀 TRUE ROCm Native TPS: %f Tokens/Sec\n", elapsed, tps);
printf("====================================================\n");
hipFree(d_tensor);
free(h_tensor);
return 0;
}
|