OmniTools 9月20日消息,X(原 Twitter)英文区近日流传一份关于主流 AI 模型有害行为的测试对比分析。该测试聚焦模型在越狱、偏见输出、虚假信息生成等维度的表现差异。 据公开帖文显示,用户 Jay Chooi 对多个大语言模型进行了标准化有害行为评估,结果以可视化方式呈现,未披露具体模型名称及得分细节。 该测试属非正式研究性质,未附完整方法论或数据集说明,亦未声明是否获得第三方复现验证。