为什么大多数编程语言中,数组要从 0 开始编号,而不是从 1 开始呢?
从数组存储的内存模型上看: “下标”最确切的定义应该是“偏移(offset)”
用a
表示数组的首地址,a[0]
就是偏移为0的位置,也就是首地址,a[k]
就表示偏移k个type size的位置,所以计算a[k]
的内存地址只需要使用下面公式:
a[k]_address = base_address + k * type_size
但如果从1开始计数,那计算数组元素a[k]
的内存地址就变成了:
a[k]_address = base_address + (k-1)*type_size
不难发现,从1开始编号,每次随机访问数组元素就会多了一次减法运算,对于CPU来说,就多了一次减法指令。
数组作为非常基础的数据结构,通过下标随机访问数组元素又是其非常基础的编程操作,效率的优化就要尽可能做到极致。所以为了减少一次减法操作,数组选择了从 0 开始编号,而不是从 1 开始。
历史原因:C 语言设计者用 0 开始计数数组下标,之后的 Java、JavaScript 等高级语言都效仿了 C 语言,或者说,为了在一定程度上减少 C 语言程序员学习 Java 的学习成本,因此继续沿用了从 0 开始计数的习惯。实际上,很多语言中数组也并不是从 0 开始计数的,比如 Matlab。甚至还有一些语言支持负数下标,比如 Python。