跳到正文
简体中文
工作台什么都不上传的工具
ODERSA 协会的一间工坊什么都不外传,什么都不留存,什么都到不了我们手里。

工坊 · 数词数

怎么用 : 数词数

“多少个字符?”并没有唯一答案,而这正是这件工具第一件要给您看的事:一个表情符号占两个码元、一个码位,而屏幕上只是一个符号。三种数法分开显示,各自有什么用也写在旁边。

打开工具

词数统计本该是网络上最简单的一件工具。实际上,大多数只给一个字符数,却对真正要紧的那个问题闭口不谈:它给的是三种可能数法里的哪一种。一个表情符号在计算机内存里占两个码元,在 Unicode 目录里只是一个码位,在屏幕上只是一个符号。一个“一家人”表情符号占七个码元,在屏幕上仍然只是一个符号。按不同的数法,您的文字能不能塞进那个要粘贴的输入框,结论是不一样的。

所以这件工具三种都显示出来,并且写明各自的用处:表单和数据库几乎总是按码元数,而人数的是看得见的符号。它还会给出词数、句子数、段落数、不重复的词数、平均句长,以及您文中最长的那一句,而最后这一项在改稿时最有用。

最后它会算一个易读度指数,并把用的公式连同它最初发表的出处和它的局限一起显示出来。这类指数只量两样东西:您句子的长度,和您用词的音节数。它们完全不管文章的连贯性、结构,也不管读者原本知道些什么。这是 1981 年以来公开发表并被广泛认可的批评,而一件工具如果给您一个分数却不提这一点,就是在让您误以为量到了质量。

怎么用

  1. 把您的文字粘进来。它不会离开您的设备,这对一篇还没发表的稿子很要紧。
  2. 选好文字的语言:法语和英语的易读度公式不一样,把一个套到另一个上毫无意义。
  3. 先看三种字符数,再看易读度和它的局限,最后看那句最长的话。改掉一句过长的话,往往比花十分钟做零碎修补更管用。

支持的格式

工具处理的是纯文字。从文字处理软件里带过来的格式不计入统计:只数词。要把复制粘贴带来的东西清掉,同一个专区里的“清理粘贴过来的格式”正是干这个的。

一段文字,打进来或者粘进来

最多 200000 个符号,大约是一本 350 页的书。再往上,数音节这一步在标签页里会等出明显的停顿。

查看兼容性对照表

它的限制

音节数是估出来的,而法语根本没有一套公认的算法

要把音节数准,就得有一部发音词典,而发音又看上下文:法语 porte 里的 e 不发音,portez 里的也不发音,portefeuille 里的有时发。我们用的是按元音组划分的经验规则,并去掉词尾不发音的 e 和 es 结尾。英语从 1986 年起有一套公开发表的经验规则;法语这边,我们查下来没有找到任何一套称得上通行的。后果是:易读度指数只是个数量级,绝不是精确到小数位的测量。

法语公式里的那个常数,有的说 207,有的说 209,我们两个都显示

Flesch 指数的法语改编版由 Kandel 和 Moles 于 1958 年发表在《广播电视研究手册》上。我们没能拿到原文,而二手资料在这一个常数上互相打架。与其闷声选一个,工具干脆两个都算出来,并把这件事说明白。差别是百分制上的两分:它不改变结论,但它改变我们能老实地断言到什么程度。

易读度指数量的不是文章的质量

它只看句子的长度和每个词的音节数。一篇由短句和简单词堆成的、彻底不知所云的文字,也能拿到很高的分。这个批评是公开发表并被认可的:这类公式当初是为给中小学教材分级而建的,它们不管文章的结构、不管导航提示,也不管读者已有的知识。请把这个指数当成一个提醒您句子太长的信号,别把它当成一个分数。

数屏幕上看得见的符号,需要一个老浏览器没有的函数

把一段文字切成看得见的符号,前提是知道 Unicode 里那些把一个字母和它的附加符号、一面旗子、或者一家人表情符号归成一体的规则。做这件事的原生函数在 Chrome 上是 2020 年到位的,Safari 是 2021 年,Firefox 是 2024 年。没有它的时候,工具不去猜:它写明这个浏览器上给不出这个数,这比给一个错数字要好。

断句是经验规则,不是确定无疑的事

句号能分开两句话,但它也用来结束一个缩写、一个小数、一个网址。工具要求句末符号后面跟一个空格或者文末,而且不在两个数字之间断开。即便如此,法语的 M. Dupont est arrivé. 还是会被数成两句:这是“一条一行就说得清的规则”所付的代价,好过为每种语言维护一张缩写清单。

阅读时长用的是约定俗成的数值,我们把它写出来

我们按默读每分钟 200 词、朗读每分钟 130 词计算。这是通行的数量级,不是在您身上量出来的:读技术文章会慢得多,读得快的人又高得多。我们把这个约定写在数字旁边,好让您自己在心里修正。

关于这个工具的问题

我的文字会被发到什么地方吗?

不会,而且这一点在这里格外要紧:粘进词数统计器的,往往是一篇论文、一封求职信、一篇还没发表的稿子。三十秒就能验证:按 F12 打开开发者工具,切到“网络”标签页,清空列表,然后把文字粘进来数一遍。一行都不会冒出来。把网断掉再做一遍:工具表现完全一样。

字符数为什么有三个不同的数字?

因为这个问题有三个都对的答案,而且差距不是可以忽略的。一个普通表情符号在计算机内存里占两个码元、在 Unicode 里占一个码位、在屏幕上是一个符号。一个“一家人”表情符号最多能占七个码元,在屏幕上仍是一个符号。表单和数据库几乎总是按码元数:如果您的消息要塞进一个 280 的框里,说了算的就是那个数字。而一个人类校对,数的是看得见的符号。

易读度指数信得过吗?

当信号,信得过。当分数,信不过。它只量您句子的长度和用词的音节数:一篇由短词堆成的、彻底不知所云的文字也能拿高分。这类公式出自 1940 年代,当初是为给中小学教材分级而建的;对它的误用从 1981 年起就在学术文献里受到批评。这个页面上最有用的多半不是那个指数,而是底下显示的您文中最长的那一句。

法语公式为什么显示两个常数?

因为我们不知道哪个才对,而把这件事说出来好过闷声选一个。Flesch 指数的法语改编版由 Kandel 和 Moles 于 1958 年发表。我们没能拿到原文,而引用它的资料给出的常数有的是 207,有的是 209。差别是百分制上的两分:它不改变结论,但它改变我们能老实地断言到什么程度。

词数跟我的文字处理软件对得上吗?

几乎总是对得上,差几个词。差别出在边界情形上:中间带空格的数字、行末被连字符断开的词、一个网址。我们把任何一串字母或数字连同其内部的连字符和撇号算作一个词:porte-monnaie 算一个,c'est-à-dire 也算一个。如果您的编辑器把它们算成两个,那是它在连字符上断开了。

有长度上限吗?

二十万个符号,大约是一本三百五十页的书。这个上限不是为了省服务器,因为压根没有服务器:再往上,数音节这一步在标签页里会等出明显的停顿,而一件看着卡住不动的工具是坏工具。超了就按章节切开来数。