pytorch - 💡(How to fix) Fix [Inductor] Correctness discrepancy in torch.minimum with signed zeros (-0.0 vs 0.0) on CUDA (bfloat16)

Code Example

import torch

def fn(x, y):
    return torch.minimum(x, y)

x = torch.tensor([-0.0], dtype=torch.bfloat16, device="cuda")
y = torch.tensor([0.0], dtype=torch.bfloat16, device="cuda")

eager_out = fn(x, y)
inductor_fn = torch.compile(fn)
inductor_out = inductor_fn(x, y)

print("--- Output ---")
print(f"Eager:    {eager_out.item()} (Hex: {eager_out.view(torch.int16).item() & 0xFFFF:#06x})")
print(f"Inductor: {inductor_out.item()}  (Hex: {inductor_out.view(torch.int16).item() & 0xFFFF:#06x})")

---

(torch-nightly) xyt19@Oasis:/tmp$ python bug.py
--- Output ---
Eager:    -0.0 (Hex: 0x8000)
Inductor: 0.0  (Hex: 0x0000)

🐛 Describe the bug

There is a correctness discrepancy between eager mode and torch.compile (Inductor) when calling torch.minimum with -0.0 and 0.0 using bfloat16 tensors on CUDA.

Eager mode preserves the negative sign and returns -0.0 (0x8000), whereas torch.compile returns 0.0 (0x0000).

Reproduction Script

import torch

def fn(x, y):
    return torch.minimum(x, y)

x = torch.tensor([-0.0], dtype=torch.bfloat16, device="cuda")
y = torch.tensor([0.0], dtype=torch.bfloat16, device="cuda")

eager_out = fn(x, y)
inductor_fn = torch.compile(fn)
inductor_out = inductor_fn(x, y)

print("--- Output ---")
print(f"Eager:    {eager_out.item()} (Hex: {eager_out.view(torch.int16).item() & 0xFFFF:#06x})")
print(f"Inductor: {inductor_out.item()}  (Hex: {inductor_out.view(torch.int16).item() & 0xFFFF:#06x})")

Actual Output

(torch-nightly) xyt19@Oasis:/tmp$ python bug.py
--- Output ---
Eager:    -0.0 (Hex: 0x8000)
Inductor: 0.0  (Hex: 0x0000)

Expected Behavior

torch.compile should match the eager mode output and return -0.0 (Hex: 0x8000).

Versions

PyTorch version: 2.13.0.dev20260521+cu130 Is debug build: False CUDA used to build PyTorch: 13.0 ROCM used to build PyTorch: N/A

OS: Ubuntu 24.04.4 LTS (x86_64) GCC version: (Ubuntu 13.3.0-6ubuntu2~24.04.1) 13.3.0 Clang version: 18.1.3 (1ubuntu1) CMake version: version 3.28.3 Libc version: glibc-2.39

Python version: 3.10.20 (main, Mar 11 2026, 17:46:40) [GCC 14.3.0] (64-bit runtime) Python platform: Linux-5.15.167.4-microsoft-standard-WSL2-x86_64-with-glibc2.39 Is CUDA available: True CUDA runtime version: 12.0.140 Nvidia driver version: 596.49 cuDNN version: Probably one of the following: /usr/lib/x86_64-linux-gnu/libcudnn.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_adv.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_cnn.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_engines_precompiled.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_engines_runtime_compiled.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_engines_tensor_ir.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_graph.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_heuristic.so.9.21.1 /usr/lib/x86_64-linux-gnu/libcudnn_ops.so.9.21.1 Is XPU available: False HIP runtime version: N/A MIOpen runtime version: N/A Is XNNPACK available: True Caching allocator config: N/A ersions of relevant libraries: [pip3] numpy==2.2.6 [pip3] nvidia-cublas==13.1.1.3 [pip3] nvidia-cuda-cupti==13.0.85 [pip3] nvidia-cuda-nvrtc==13.0.88 [pip3] nvidia-cuda-runtime==13.0.96 [pip3] nvidia-cudnn-cu13==9.20.0.48 [pip3] nvidia-cufft==12.0.0.61 [pip3] nvidia-curand==10.4.0.35 [pip3] nvidia-cusolver==12.0.4.66 [pip3] nvidia-cusparse==12.6.3.3 [pip3] nvidia-cusparselt-cu13==0.8.1 [pip3] nvidia-nccl-cu13==2.29.7 [pip3] nvidia-nvjitlink==13.0.88 [pip3] nvidia-nvtx==13.0.85 [pip3] torch==2.13.0.dev20260521+cu130 [pip3] torchaudio==2.11.0.dev20260525+cu130 [pip3] torchvision==0.28.0.dev20260525+cu130 [pip3] triton==3.7.0+git88b227e2 [conda] numpy 2.2.6 pypi_0 pypi [conda] nvidia-cublas 13.1.1.3 pypi_0 pypi [conda] nvidia-cuda-cupti 13.0.85 pypi_0 pypi [conda] nvidia-cuda-nvrtc 13.0.88 pypi_0 pypi [conda] nvidia-cuda-runtime 13.0.96 pypi_0 pypi [conda] nvidia-cudnn-cu13 9.20.0.48 pypi_0 pypi [conda] nvidia-cufft 12.0.0.61 pypi_0 pypi [conda] nvidia-curand 10.4.0.35 pypi_0 pypi [conda] nvidia-cusolver 12.0.4.66 pypi_0 pypi [conda] nvidia-cusparse 12.6.3.3 pypi_0 pypi [conda] nvidia-cusparselt-cu13 0.8.1 pypi_0 pypi [conda] nvidia-nccl-cu13 2.29.7 pypi_0 pypi [conda] nvidia-nvjitlink 13.0.88 pypi_0 pypi [conda] nvidia-nvtx 13.0.85 pypi_0 pypi [conda] torch 2.13.0.dev20260521+cu130 pypi_0 pypi [conda] torchaudio 2.11.0.dev20260525+cu130 pypi_0 pypi [conda] torchvision 0.28.0.dev20260525+cu130 pypi_0 pypi [conda] triton 3.7.0+git88b227e2 pypi_0 pypi

cc @ptrblck @msaroufim @eqy @tinglvv @nWEIdia @chauhang @penguinwu @voznesenskym @EikanWang @jgong5 @Guobing-Chen @XiaobingSuper @zhuhaozhe @blzheng @wenzhe-nrv @jiayisunx @ipiszy @kadeng @muchulee8 @amjames @aakhundov @coconutruben @jataylo

Data

Security

Network

Code

UI/UX

Text

System

Multimedia

Protocol

API

Engineering

pytorch - 💡(How to fix) Fix [Inductor] Correctness discrepancy in torch.minimum with signed zeros (-0.0 vs 0.0) on CUDA (bfloat16)

Recommended Tools

GitHub issue graph ai analysis