import torch
import numpy as np
import torch_npu

from torch_npu.testing.testcase import TestCase, run_tests
from torch_npu.testing.common_utils import create_common_tensor


class TestSort(TestCase):
    def cpu_op_exec(self, input1, dim):
        output, indices = torch.sort(input1, dim=dim)
        output = output.numpy()
        indices = indices.numpy()
        return output, indices

    def npu_op_exec(self, input1, dim):
        output, indices = torch.sort(input1, dim=dim)
        output = output.cpu()
        indices = indices.cpu()
        output = output.numpy()
        indices = indices.numpy()
        return output, indices

    def cpu_default_op_exec(self, input1):
        output, indices = torch.sort(input1)
        output = output.numpy()
        indices = indices.numpy()
        return output, indices

    def npu_default_op_exec(self, input1):
        output, indices = torch.sort(input1)
        output = output.cpu()
        indices = indices.cpu()
        output = output.numpy()
        indices = indices.numpy()
        return output, indices

    # at present accuracy under FP32 is inadequate
    def _test_sort_shape_format_fp32(self):
        shape_format = [
            [[np.float32, 0, (8, 4, 3, 9)], 2],
            [[np.float32, 0, (2, 3)]],
            [[np.float32, 0, (1, 7)], 0],
            [[np.float32, 0, (1, 5, 6)], 1],
        ]

        for item in shape_format:
            cpu_input1, npu_input1 = create_common_tensor(item[0], -100, 100)
            if len(item) > 1:
                cpu_output, cpu_indices = self.cpu_op_exec(cpu_input1, item[1])
                npu_output, npu_indices = self.npu_op_exec(npu_input1, item[1])
            else:
                cpu_output, cpu_indices = self.cpu_default_op_exec(cpu_input1)
                npu_output, npu_indices = self.npu_default_op_exec(npu_input1)
            self.assertRtolEqual(cpu_output, npu_output)
            self.assertRtolEqual(cpu_indices, npu_indices)

    def test_sort_shape_format_fp16(self):
        shape_format = [
            [[np.float16, 0, (8, 4, 3, 9)], 2],
            [[np.float16, 0, (2, 3)]],
            [[np.float16, 0, (1, 7)], 0],
            [[np.float16, 0, (1, 5, 6)], 1],
        ]

        for item in shape_format:
            cpu_input1, npu_input1 = create_common_tensor(item[0], -100, 100)
            if len(item) > 1:
                cpu_output, cpu_indices = self.cpu_op_exec(cpu_input1.to(torch.float32), item[1])
                npu_output, npu_indices = self.npu_op_exec(npu_input1, item[1])
            else:
                cpu_output, cpu_indices = self.cpu_default_op_exec(cpu_input1.to(torch.float32))
                npu_output, npu_indices = self.npu_default_op_exec(npu_input1)
            self.assertRtolEqual(cpu_output.astype(np.float16), npu_output)

    def test_sort_stride(self):
        cpu_input = torch.tensor([[3, 1, 2], [6, 4, 5]], dtype=torch.float32)
        npu_input = cpu_input.npu()
        cpu_values, cpu_indices = torch.sort(cpu_input, dim=1)
        npu_values, npu_indices = torch.sort(npu_input, dim=1)
        self.assertEqual(cpu_values.stride(), npu_values.stride())
        self.assertEqual(cpu_indices.stride(), npu_indices.stride())


if __name__ == "__main__":
    run_tests()