为了在避免测试所有特征子集所带来的高昂计算成本的同时设计出有效的分类器,作者针对各种判别任务(如人类与机器人、特定作者与他人等)对特征进行了单独评估。通过观察这些配对任务中表现的一致性,作者绘制出了特征可靠性与预测能力的图谱。
该研究分析了包括字符/词频、n-gram 和词性(POS)标注在内的风格标记。词性 n-gram 等特征表现尤为稳健,因为它们捕捉的是句法结构而非单纯的词汇,从而有助于避免因主题内容而产生的偏差。虽然原始词频也很有效,但它们有可能会捕捉到特定主题的关键词,而非作者的风格特征。
作者强调,尽管单特征性能图表提供了一个直观且信息丰富的预测强度概览,但它并不能反映全貌。特征间的相互作用——即组合可能产生的冗余或协同效应——至关重要。最终,虽然作者始于系统性的评估,但最终的生成模型依赖于对表现最佳特征的精选。这说明,尽管算法评估很有用,但实际的分类器设计往往需要在严谨的数据分析与启发式选择之间取得平衡。
**Bespoke**,亦称“女王准则”(The Queen’s Code),是一种讽刺性的编程语言,旨在以维多利亚时代的正式礼仪取代现代编程中简洁且咄咄逼人的指令。该语言的创作前提是将编译器视为受人尊敬的合作伙伴,而非卑微的工具。Bespoke 要求所有代码——从变量声明到内存管理——都必须以礼貌的请求方式表达。
该语言拒绝使用诸如 `int` 或 `bool` 之类的“粗俗”简写,要求使用“一个整数”(An Integer Number)和“一个真值”(A Truth Value)等完整且具有描述性的类型。语句以句号而非分号结尾,且编译器强制执行英式拼写和得体的礼仪。即使是更改变量,也需要表达谦卑的歉意;并发处理则依赖“相互谦让”而非锁机制。
如果程序遇到运行时错误,它不会崩溃,而是会递交一份正式的道歉辞呈并退出。尽管作者承认 Bespoke 并不能提升性能或解决并发错误,但它挑战了现代计算中那种充满敌意的基调。它提出了一个深刻且充满奇思妙想的问题:如果我们非要向机器索取不可能之事,难道我们不能至少保持客气吗?