核心总结

  • Heretic是一个全自动工具,用于移除Transformer语言模型的审查机制(“安全对齐”),无需昂贵后训练。
  • 结合方向性消融技术和Optuna驱动的参数优化器,自动化寻找高质量消融参数,平衡去审查效果与模型性能保留。
  • 支持多种模型架构(稠密模型、多模态、MoE等),生成模型在拒绝率和KL散度指标上优于或媲美人工优化版本。
  • 用户友好,无需深入理解Transformer原理,通过命令行即可操作。
  • 在默认无监督配置下,生成的解禁模型既有效降低审查,又最大程度保留原始模型能力。

标签

语言模型 去审查工具 自动化优化 transformer ai安全