核心总结 Heretic是一个全自动工具,用于移除Transformer语言模型的审查机制(“安全对齐”),无需昂贵后训练。 结合方向性消融技术和Optuna驱动的参数优化器,自动化寻找高质量消融参数,平衡去审查效果与模型性能保留。 支持多种模型架构(稠密模型、多模态、MoE等),生成模型在拒绝率和KL散度指标上优于或媲美人工优化版本。 用户友好,无需深入理解Transformer原理,通过命令行即可操作。 在默认无监督配置下,生成的解禁模型既有效降低审查,又最大程度保留原始模型能力。 标签 语言模型 去审查工具 自动化优化 transformer ai安全