LICENSE
README.md
setup.py
test/test_ao_models.py
test/test_low_bit_optim.py
test/test_model_architecture.py
test/test_ops.py
test/test_ops_rowwise_scaled_linear_cutlass.py
test/test_ops_rowwise_scaled_linear_sparse_cutlass.py
test/test_utils.py
torchao/__init__.py
torchao/_executorch_ops.py
torchao/ops.py
torchao/utils.py
torchao.egg-info/PKG-INFO
torchao.egg-info/SOURCES.txt
torchao.egg-info/dependency_links.txt
torchao.egg-info/requires.txt
torchao.egg-info/top_level.txt
torchao/_models/__init__.py
torchao/_models/_eval.py
torchao/_models/utils.py
torchao/_models/llama/__init__.py
torchao/_models/llama/eval.py
torchao/_models/llama/generate.py
torchao/_models/llama/model.py
torchao/_models/llama/tokenizer.py
torchao/_models/sam2/__init__.py
torchao/_models/sam2/automatic_mask_generator.py
torchao/_models/sam2/build_sam.py
torchao/_models/sam2/map_tensor.py
torchao/_models/sam2/sam2_image_predictor.py
torchao/_models/sam2/sam2_video_predictor.py
torchao/_models/sam2/modeling/__init__.py
torchao/_models/sam2/modeling/memory_attention.py
torchao/_models/sam2/modeling/memory_encoder.py
torchao/_models/sam2/modeling/position_encoding.py
torchao/_models/sam2/modeling/sam2_base.py
torchao/_models/sam2/modeling/sam2_utils.py
torchao/_models/sam2/modeling/backbones/__init__.py
torchao/_models/sam2/modeling/backbones/hieradet.py
torchao/_models/sam2/modeling/backbones/image_encoder.py
torchao/_models/sam2/modeling/backbones/utils.py
torchao/_models/sam2/modeling/sam/__init__.py
torchao/_models/sam2/modeling/sam/mask_decoder.py
torchao/_models/sam2/modeling/sam/prompt_encoder.py
torchao/_models/sam2/modeling/sam/transformer.py
torchao/_models/sam2/utils/__init__.py
torchao/_models/sam2/utils/amg.py
torchao/_models/sam2/utils/misc.py
torchao/_models/sam2/utils/transforms.py
torchao/core/__init__.py
torchao/core/config.py
torchao/dtypes/__init__.py
torchao/dtypes/_nf4tensor_api.py
torchao/dtypes/affine_quantized_tensor.py
torchao/dtypes/affine_quantized_tensor_ops.py
torchao/dtypes/fbgemm_fp8_tensor.py
torchao/dtypes/nf4tensor.py
torchao/dtypes/utils.py
torchao/dtypes/floatx/__init__.py
torchao/dtypes/floatx/cutlass_semi_sparse_layout.py
torchao/dtypes/floatx/float8_layout.py
torchao/dtypes/floatx/floatx_tensor_core_layout.py
torchao/dtypes/uintx/__init__.py
torchao/dtypes/uintx/bitpacking.py
torchao/dtypes/uintx/block_sparse_layout.py
torchao/dtypes/uintx/cutlass_int4_packed_layout.py
torchao/dtypes/uintx/dyn_int8_act_int4_wei_cpu_layout.py
torchao/dtypes/uintx/gemlite_layout.py
torchao/dtypes/uintx/int4_cpu_layout.py
torchao/dtypes/uintx/int4_xpu_layout.py
torchao/dtypes/uintx/marlin_qqq_tensor.py
torchao/dtypes/uintx/marlin_sparse_layout.py
torchao/dtypes/uintx/packed_linear_int8_dynamic_activation_intx_weight_layout.py
torchao/dtypes/uintx/plain_layout.py
torchao/dtypes/uintx/q_dq_layout.py
torchao/dtypes/uintx/semi_sparse_layout.py
torchao/dtypes/uintx/tensor_core_tiled_layout.py
torchao/dtypes/uintx/uint4_layout.py
torchao/dtypes/uintx/uintx_layout.py
torchao/experimental/__init__.py
torchao/experimental/op_lib.py
torchao/experimental/op_lib_utils.py
torchao/experimental/packed_linear_int8_dynamic_activation_intx_weight_layout.py
torchao/experimental/q_dq_layout.py
torchao/experimental/quant_api.py
torchao/experimental/quant_passes.py
torchao/experimental/temp_build.py
torchao/float8/__init__.py
torchao/float8/config.py
torchao/float8/distributed_utils.py
torchao/float8/float8_linear.py
torchao/float8/float8_linear_utils.py
torchao/float8/float8_ops.py
torchao/float8/float8_scaling_utils.py
torchao/float8/float8_tensor_parallel.py
torchao/float8/float8_training_tensor.py
torchao/float8/float8_utils.py
torchao/float8/fsdp_utils.py
torchao/float8/inference.py
torchao/float8/types.py
torchao/kernel/__init__.py
torchao/kernel/autotuner.py
torchao/kernel/bsr_triton_ops.py
torchao/kernel/intmm.py
torchao/kernel/intmm_triton.py
torchao/optim/__init__.py
torchao/optim/adam.py
torchao/optim/cpu_offload.py
torchao/optim/quant_utils.py
torchao/optim/subclass_4bit.py
torchao/optim/subclass_8bit.py
torchao/optim/subclass_fp8.py
torchao/prototype/__init__.py
torchao/prototype/custom_fp_utils.py
torchao/prototype/autoround/__init__.py
torchao/prototype/autoround/autoround_llm.py
torchao/prototype/autoround/core.py
torchao/prototype/autoround/eval_autoround.py
torchao/prototype/autoround/multi_tensor.py
torchao/prototype/autoround/utils.py
torchao/prototype/awq/__init__.py
torchao/prototype/awq/api.py
torchao/prototype/awq/core.py
torchao/prototype/awq/example.py
torchao/prototype/blockwise_fp8_inference/__init__.py
torchao/prototype/blockwise_fp8_inference/blockwise_linear.py
torchao/prototype/blockwise_fp8_inference/blockwise_quantization.py
torchao/prototype/blockwise_fp8_training/__init__.py
torchao/prototype/blockwise_fp8_training/kernels.py
torchao/prototype/blockwise_fp8_training/linear.py
torchao/prototype/common/__init__.py
torchao/prototype/common/profiling_tools.py
torchao/prototype/common/triton/__init__.py
torchao/prototype/common/triton/matmul.py
torchao/prototype/common/triton/matmul_perf_model.py
torchao/prototype/float8nocompile/__init__.py
torchao/prototype/float8nocompile/float8nocompile_linear.py
torchao/prototype/float8nocompile/float8nocompile_linear_test.py
torchao/prototype/float8nocompile/float8nocompile_linear_utils.py
torchao/prototype/float8nocompile/float8nocompile_scaling_utils.py
torchao/prototype/float8nocompile/kernels/__init__.py
torchao/prototype/float8nocompile/kernels/fp8_dynamic_tensorwise.py
torchao/prototype/float8nocompile/kernels/fp8_dynamic_tensorwise_test.py
torchao/prototype/hqq/__init__.py
torchao/prototype/hqq/example.py
torchao/prototype/hqq/hqq_tinygemm_linear.py
torchao/prototype/hqq/kernels.py
torchao/prototype/hqq/mixed_mm.py
torchao/prototype/inductor/__init__.py
torchao/prototype/inductor/int8_sdpa_lowering.py
torchao/prototype/inductor/codegen/__init__.py
torchao/prototype/inductor/codegen/cpp_int8_sdpa_template.py
torchao/prototype/inductor/codegen/utils.py
torchao/prototype/inductor/fx_passes/__init__.py
torchao/prototype/inductor/fx_passes/da8w4_concat_linear_fusion_cpu.py
torchao/prototype/inductor/fx_passes/int8_sdpa_fusion.py
torchao/prototype/moe_quant/__init__.py
torchao/prototype/moe_quant/llama4_quant.py
torchao/prototype/moe_quant/quantizable_moe_modules.py
torchao/prototype/moe_quant/utils.py
torchao/prototype/moe_training/__init__.py
torchao/prototype/moe_training/conversion_utils.py
torchao/prototype/moe_training/scaled_grouped_mm.py
torchao/prototype/moe_training/tensor.py
torchao/prototype/moe_training/utils.py
torchao/prototype/moe_training/kernels/__init__.py
torchao/prototype/moe_training/kernels/float8_rowwise.py
torchao/prototype/moe_training/kernels/jagged_float8_scales.py
torchao/prototype/mx_formats/__init__.py
torchao/prototype/mx_formats/config.py
torchao/prototype/mx_formats/constants.py
torchao/prototype/mx_formats/fp_format_spec.py
torchao/prototype/mx_formats/inference_workflow.py
torchao/prototype/mx_formats/kernels.py
torchao/prototype/mx_formats/mx_funcs.py
torchao/prototype/mx_formats/mx_linear.py
torchao/prototype/mx_formats/mx_ops.py
torchao/prototype/mx_formats/mx_tensor.py
torchao/prototype/mx_formats/nvfp4_tensor.py
torchao/prototype/mx_formats/utils.py
torchao/prototype/paretoq/__init__.py
torchao/prototype/paretoq/train.py
torchao/prototype/paretoq/models/__init__.py
torchao/prototype/paretoq/models/configuration_llama.py
torchao/prototype/paretoq/models/modeling_llama_quant.py
torchao/prototype/paretoq/models/utils_quant.py
torchao/prototype/parq/__init__.py
torchao/prototype/parq/utils.py
torchao/prototype/parq/optim/__init__.py
torchao/prototype/parq/optim/binarelax.py
torchao/prototype/parq/optim/parq.py
torchao/prototype/parq/optim/proxmap.py
torchao/prototype/parq/optim/quantopt.py
torchao/prototype/parq/quant/__init__.py
torchao/prototype/parq/quant/lsbq.py
torchao/prototype/parq/quant/quant_api.py
torchao/prototype/parq/quant/quantizer.py
torchao/prototype/parq/quant/uniform.py
torchao/prototype/parq/quant/uniform_torchao.py
torchao/prototype/qat/__init__.py
torchao/prototype/qat/nvfp4.py
torchao/prototype/quantization/__init__.py
torchao/prototype/quantization/autoquant_v2.py
torchao/prototype/quantization/codebook/__init__.py
torchao/prototype/quantization/codebook/codebook_ops.py
torchao/prototype/quantization/codebook/codebook_quantized_tensor.py
torchao/prototype/quantization/codebook_coreml/__init__.py
torchao/prototype/quantization/codebook_coreml/api.py
torchao/prototype/quantization/codebook_coreml/codebook_ops.py
torchao/prototype/quantization/codebook_coreml/codebook_quantized_tensor.py
torchao/prototype/quantization/codebook_groupwise/__init__.py
torchao/prototype/quantization/codebook_groupwise/api.py
torchao/prototype/quantization/codebook_groupwise/codebook_quantized_tensor.py
torchao/prototype/quantization/codebook_utils/__init__.py
torchao/prototype/quantization/codebook_utils/codebook_utils.py
torchao/prototype/quantization/dynamic_activation_lut/__init__.py
torchao/prototype/quantization/dynamic_activation_lut/api.py
torchao/prototype/quantization/dynamic_activation_lut/int8_dynamic_activation_lut_tensor.py
torchao/prototype/quantization/gguf/__init__.py
torchao/prototype/quantization/gguf/api.py
torchao/prototype/quantization/gguf/gguf_quantized_tensor.py
torchao/prototype/quantization/mixed_precision/__init__.py
torchao/prototype/quantization/mixed_precision/scripts/BO_acc_modelsize.py
torchao/prototype/quantization/mixed_precision/scripts/BO_acc_throughput.py
torchao/prototype/quantization/mixed_precision/scripts/__init__.py
torchao/prototype/quantization/mixed_precision/scripts/fit.py
torchao/prototype/quantization/mixed_precision/scripts/hessian_grad.py
torchao/prototype/quantization/mixed_precision/scripts/hessian_vhp.py
torchao/prototype/quantization/mixed_precision/scripts/mp_quant_eval.py
torchao/prototype/quantization/mixed_precision/scripts/naive_intNwo.py
torchao/prototype/quantization/mixed_precision/scripts/utils.py
torchao/prototype/quantization/module_swap/__init__.py
torchao/prototype/quantization/module_swap/module_swap.py
torchao/prototype/quantization/module_swap/quantized_modules.py
torchao/prototype/quantization/module_swap/quantizers.py
torchao/prototype/quantization/module_swap/range_setting_methods.py
torchao/prototype/quantization/module_swap/utils.py
torchao/prototype/quantization/module_swap/algorithms/__init__.py
torchao/prototype/quantization/module_swap/algorithms/kmeans_codebook.py
torchao/prototype/quantization/module_swap/data_getters/__init__.py
torchao/prototype/quantization/module_swap/data_getters/llm_ptq_data_getter.py
torchao/prototype/quantization/module_swap/data_getters/ptq_data_getter.py
torchao/prototype/quantization/subgraph_utils/__init__.py
torchao/prototype/quantization/subgraph_utils/extract_subgraphs.py
torchao/prototype/quantized_training/__init__.py
torchao/prototype/quantized_training/bitnet.py
torchao/prototype/quantized_training/int8.py
torchao/prototype/quantized_training/int8_mixed_precision.py
torchao/prototype/quantized_training/int8_mm.py
torchao/prototype/smoothquant/__init__.py
torchao/prototype/smoothquant/api.py
torchao/prototype/smoothquant/core.py
torchao/prototype/smoothquant/example.py
torchao/prototype/sparsity/__init__.py
torchao/prototype/sparsity/activation/__init__.py
torchao/prototype/sparsity/activation/srelu_linear.py
torchao/prototype/sparsity/activation/utils.py
torchao/prototype/sparsity/pruner/FPGM_pruner.py
torchao/prototype/sparsity/pruner/__init__.py
torchao/prototype/sparsity/pruner/base_structured_sparsifier.py
torchao/prototype/sparsity/pruner/lstm_saliency_pruner.py
torchao/prototype/sparsity/pruner/match_utils.py
torchao/prototype/sparsity/pruner/parametrization.py
torchao/prototype/sparsity/pruner/prune_functions.py
torchao/prototype/sparsity/pruner/saliency_pruner.py
torchao/prototype/sparsity/scheduler/__init__.py
torchao/prototype/sparsity/scheduler/base_scheduler.py
torchao/prototype/sparsity/scheduler/cubic_scheduler.py
torchao/prototype/sparsity/scheduler/lambda_scheduler.py
torchao/prototype/sparsity/sparsifier/__init__.py
torchao/prototype/sparsity/sparsifier/base_sparsifier.py
torchao/prototype/sparsity/sparsifier/nearly_diagonal_sparsifier.py
torchao/prototype/sparsity/sparsifier/utils.py
torchao/prototype/sparsity/sparsifier/weight_norm_sparsifier.py
torchao/prototype/spinquant/__init__.py
torchao/prototype/spinquant/_hadamard_matrices.py
torchao/prototype/spinquant/hadamard_utils.py
torchao/prototype/spinquant/spinquant.py
torchao/quantization/__init__.py
torchao/quantization/autoquant.py
torchao/quantization/dynamic_quant.py
torchao/quantization/granularity.py
torchao/quantization/linear_activation_quantized_tensor.py
torchao/quantization/linear_activation_scale.py
torchao/quantization/linear_activation_weight_observed_tensor.py
torchao/quantization/linear_quant_modules.py
torchao/quantization/observer.py
torchao/quantization/quant_api.py
torchao/quantization/quant_primitives.py
torchao/quantization/smoothquant.py
torchao/quantization/subclass.py
torchao/quantization/transform_module.py
torchao/quantization/unified.py
torchao/quantization/utils.py
torchao/quantization/weight_only.py
torchao/quantization/weight_tensor_linear_activation_quantization.py
torchao/quantization/GPTQ/GPTQ.py
torchao/quantization/GPTQ/__init__.py
torchao/quantization/marlin_qqq/__init__.py
torchao/quantization/marlin_qqq/utils.py
torchao/quantization/prototype/__init__.py
torchao/quantization/prototype/qat/__init__.py
torchao/quantization/prototype/qat/_module_swap_api.py
torchao/quantization/prototype/qat/affine_fake_quantized_tensor.py
torchao/quantization/prototype/qat/api.py
torchao/quantization/prototype/qat/embedding.py
torchao/quantization/prototype/qat/fake_quantizer.py
torchao/quantization/prototype/qat/linear.py
torchao/quantization/pt2e/__init__.py
torchao/quantization/pt2e/_affine_quantization.py
torchao/quantization/pt2e/_numeric_debugger.py
torchao/quantization/pt2e/constant_fold.py
torchao/quantization/pt2e/convert.py
torchao/quantization/pt2e/export_utils.py
torchao/quantization/pt2e/fake_quantize.py
torchao/quantization/pt2e/graph_utils.py
torchao/quantization/pt2e/lowering.py
torchao/quantization/pt2e/observer.py
torchao/quantization/pt2e/prepare.py
torchao/quantization/pt2e/qat_utils.py
torchao/quantization/pt2e/quantize_pt2e.py
torchao/quantization/pt2e/reference_representation_rewrite.py
torchao/quantization/pt2e/utils.py
torchao/quantization/pt2e/inductor_passes/__init__.py
torchao/quantization/pt2e/inductor_passes/x86.py
torchao/quantization/pt2e/quantizer/__init__.py
torchao/quantization/pt2e/quantizer/arm_inductor_quantizer.py
torchao/quantization/pt2e/quantizer/composable_quantizer.py
torchao/quantization/pt2e/quantizer/duplicate_dq_pass.py
torchao/quantization/pt2e/quantizer/embedding_quantizer.py
torchao/quantization/pt2e/quantizer/port_metadata_pass.py
torchao/quantization/pt2e/quantizer/quantizer.py
torchao/quantization/pt2e/quantizer/utils.py
torchao/quantization/pt2e/quantizer/x86_inductor_quantizer.py
torchao/quantization/pt2e/quantizer/xpu_inductor_quantizer.py
torchao/quantization/qat/__init__.py
torchao/quantization/qat/affine_fake_quantized_tensor.py
torchao/quantization/qat/api.py
torchao/quantization/qat/embedding.py
torchao/quantization/qat/fake_quantize_config.py
torchao/quantization/qat/fake_quantizer.py
torchao/quantization/qat/linear.py
torchao/quantization/qat/utils.py
torchao/quantization/quantize_/__init__.py
torchao/quantization/quantize_/common/__init__.py
torchao/quantization/quantize_/common/kernel_preference.py
torchao/quantization/quantize_/common/packing_format.py
torchao/quantization/quantize_/common/quantize_tensor_kwargs.py
torchao/quantization/quantize_/workflows/__init__.py
torchao/quantization/quantize_/workflows/float8/__init__.py
torchao/quantization/quantize_/workflows/float8/float8_tensor.py
torchao/quantization/quantize_/workflows/int4/__init__.py
torchao/quantization/quantize_/workflows/int4/int4_marlin_sparse_tensor.py
torchao/quantization/quantize_/workflows/int4/int4_preshuffled_tensor.py
torchao/quantization/quantize_/workflows/int4/int4_tensor.py
torchao/quantization/quantize_/workflows/intx/__init__.py
torchao/quantization/quantize_/workflows/intx/intx_unpacked_tensor.py
torchao/sparsity/__init__.py
torchao/sparsity/blocksparse.py
torchao/sparsity/sparse_api.py
torchao/sparsity/supermask.py
torchao/sparsity/utils.py
torchao/sparsity/wanda.py
torchao/sparsity/marlin/__init__.py
torchao/sparsity/marlin/utils.py
torchao/sparsity/training/__init__.py
torchao/sparsity/training/autograd.py
torchao/sparsity/training/pointwise_ops.py
torchao/swizzle/__init__.py
torchao/swizzle/swizzle_ops.py
torchao/swizzle/swizzle_tensor.py
torchao/testing/__init__.py
torchao/testing/model_architectures.py
torchao/testing/utils.py
torchao/testing/pt2e/__init__.py
torchao/testing/pt2e/_xnnpack_quantizer.py
torchao/testing/pt2e/_xnnpack_quantizer_utils.py
torchao/testing/pt2e/utils.py
torchao/testing/training/__init__.py
torchao/testing/training/dtensor_utils.py
torchao/testing/training/fsdp2_utils.py
torchao/testing/training/roofline_utils.py
torchao/testing/training/test_utils.py