14 做正确的事情
拿世间的美好、丑陋与残酷喂养 AI 系统,却幻想它只会映照美好。
Vinay Uday Prabhu、Abeba Birhane,大规模数据集:计算机视觉的一场皮洛士式胜利?(2020)
在本书的最后一章,让我们退后一步。全书至此,我们考察了形形色色的数据系统架构,权衡了它们的利弊,也探讨了构建可靠、可伸缩、可维护应用的技术。然而,我们一直略过了讨论中一个重要而根本的部分,现在该把它补上了。
每个系统都是为某种目的而建;我们采取的每个行动,都会产生预期和非预期的后果。目的也许只是赚钱,但对世界造成的影响可能远远超出最初的目的。身为构建这些系统的工程师,我们有责任仔细思考这些后果,并有意识地选择自己希望生活在怎样的世界中。
我们常把数据当作抽象事物来谈论,但请记住,许多数据集记录的是人:他们的行为、兴趣与身份。我们必须怀着人性与尊重对待这类数据。用户也是人,人的尊严至高无上 1。
软件开发越来越多地涉及重大的伦理抉择。ACM《伦理与职业行为准则》等指南可以帮助软件工程师处理这些问题 2;然而在实践中,它们很少得到讨论、应用和落实。因此,工程师和产品经理有时会轻率地对待隐私,以及产品可能造成的负面后果 3、4。
技术本身并无善恶,关键在于如何使用它,以及它会给人带来什么影响。搜索引擎这样的软件系统如此,枪支这样的武器也一样。软件工程师不能只关注技术而无视其后果;伦理责任同样要由我们承担。伦理思考并不容易,却重要得不容回避。
可是,什么算“好”、什么算“坏”,并没有明确的定义;计算领域的大多数人甚至不讨论这个问题 5。不同于计算领域的许多概念,伦理学的核心概念没有固定、确定的精确含义,而是需要解释,并且这种解释可能带有主观性 6。伦理不是照着清单逐项打勾,确认自己已经合规;它是一个参与式、迭代式的反思过程,需要与相关各方对话,并对结果负责 7。
预测分析
例如,预测分析(predictive analytics)正是人们热衷于大数据和 AI 的主要原因之一。用数据分析预测天气或疾病传播是一回事 8;预测一名已定罪者是否可能再犯、贷款申请人是否可能违约,或保险客户是否可能提出高额索赔,则是另一回事 9。后一类预测会直接影响个人的生活。
支付网络当然希望阻止欺诈交易,银行希望避免不良贷款,航空公司希望避免劫机,企业也希望避免雇到能力不足或不可信赖的人。从它们的角度看,错失商机的代价不大,不良贷款或问题员工造成的损失却高得多,因此组织自然希望谨慎行事。拿不准时,拒绝总比答应稳妥。
然而,随着算法决策越来越普遍,被某种算法标为高风险的人——无论判断正确与否——可能接连遭到这样的拒绝。一个人若被系统性地排除在就业、航空出行、保险、房屋租赁、金融服务以及社会生活的其他关键领域之外,其自由会受到极大限制,以至于这种处境被称为“算法监狱(algorithmic prison)”10。在尊重人权的国家,刑事司法制度坚持无罪推定;自动化系统却可能在没有任何罪证、几乎无从申诉的情况下,系统性地、任意地剥夺一个人参与社会的机会。
偏见与歧视
算法作出的决定不一定比人类更好,也不一定更差。每个人都可能心存偏见,即便主动设法克服也不例外;歧视性做法还可能沉淀为文化与制度。人们寄希望于以数据而非人的主观判断与直觉为依据,从而作出更公平的决定,也给传统制度中经常被忽视的人更多机会 11。
开发预测分析和 AI 系统时,我们不只是用软件规定何时同意、何时拒绝,把人的决策自动化;甚至连规则本身也交给系统从数据中推断。然而,这些系统学到的模式并不透明:即使数据中确实存在某种相关性,我们也未必知道原因。如果算法的输入带有系统性偏见,系统很可能会学到这种偏见,并在输出中将其放大 12。
许多国家的 反歧视法(anti-discrimination law)禁止根据族裔、年龄、性别、性取向、残障或信仰等 受保护特征(protected characteristic)区别对待他人。个人数据中的其他特征或许可以分析,但如果它们与受保护特征相关,又该怎么办?例如,在种族隔离的社区中,一个人的邮政编码,甚至 IP 地址,都可以有力地预测其种族。如此看来,相信算法能够以带有偏见的数据为输入,却产出公平公正的结果,实在荒谬 13、14。然而,数据驱动决策的支持者似乎经常默认这种信念;有人讽刺这种态度说,“机器学习就像为偏见洗钱” 15。
预测分析系统不过是在外推过去;如果过去充满歧视,它们就会固化并放大这种歧视 16。要让未来比过去更好,需要道德想象力,而这只有人类才能提供 17。数据与模型应该是我们的工具,而不是我们的主人。
责任与问责
自动化决策引出了 责任(responsibility)与 问责(accountability)问题 17。如果人犯了错,可以追究其责任,受决定影响的人也可以申诉。算法同样会犯错,但出了问题,谁来负责 18?自动驾驶汽车造成事故,责任由谁承担?自动信用评分算法若系统性地歧视某一种族或宗教的人,他们有没有救济途径?如果机器学习系统作出的决定受到司法审查,你能否向法官解释算法是怎样得出这一决定的?任何人都不应把责任推给算法,借此逃避问责。
信用评级机构是收集个人数据并据此作出决定的一个早期例子。糟糕的信用评分会给生活带来困难,但至少信用分通常基于当事人实际借贷历史中的相关事实,记录有误时也能更正——尽管评级机构一般不会让更正变得容易。相比之下,基于机器学习的评分算法通常使用范围广得多的输入数据,而且更加不透明,因而很难看清某项决定是如何得出的,也很难判断某个人是否受到了不公平或歧视性对待 19。
信用分概括的是“你过去表现如何?”,预测分析通常依据的却是“谁与你相似,以及与你相似的人过去表现如何?”。拿他人的行为来类比一个人,实际上就是在制造刻板印象,例如根据居住地——它往往是种族和社会经济阶层的近似指标——给人归类。那些被分错类别的人怎么办?而且,如果错误数据导致了错误决定,当事人几乎无从寻求救济 17。
许多数据本质上都是统计性的。这意味着,即使总体概率分布正确,落到个案上也很可能出错。例如,假如你所在国家的平均预期寿命是 80 岁,并不意味着你会在 80 岁生日当天去世。仅凭平均值和概率分布,很难判断某一个人究竟能活到多大年纪。同样,预测系统给出的是概率性结果,放到具体个案上完全可能出错。
盲目相信数据在决策中至高无上,不仅是一种妄想,而且非常危险。随着数据驱动决策日益普及,我们需要弄清楚如何让算法透明并接受问责,如何避免强化既有偏见,以及如何在算法不可避免地犯错时加以纠正。
我们还要弄清楚如何防止数据被用来伤害人,并让它发挥积极作用。例如,数据分析可以揭示人们生活中的财务与社会特征。一方面,这种能力可用于集中援助与支持,帮助最需要帮助的人;另一方面,掠夺性企业有时也会用它识别弱势群体,再向他们兜售高息贷款和毫无价值的大学文凭等高风险产品 17、20。
反馈循环
即便是推荐系统这类对人们生活的影响没有那么直接、深远的预测应用,也有一些难题必须正视。当服务越来越善于预测用户想看什么时,最终可能只向人们展示他们已经认同的观点,形成滋生刻板印象、错误信息与社会极化的回音室。我们已经看到了社交媒体回音室对竞选活动的影响。
当预测分析开始左右人们的生活时,自我强化的 反馈循环(feedback loop)会造成尤其恶劣的问题。例如,假设雇主用信用分评估求职者。你原本工作能力很强,信用记录也很好,却因一场自己无力控制的变故突然陷入财务困境。几次账单逾期之后,信用分随之下降,找到工作的机会也越来越少。失业又把你推向贫困,进一步拉低评分,让工作变得更加难找 17。这是有毒假设造成的恶性循环,却披着数学严谨性与数据客观性的外衣。
另一个反馈循环的例子是:经济学家发现,德国的加油站引入算法定价后,市场竞争反而减弱,消费者支付的价格随之上涨,因为算法学会了合谋 21。
我们无法总是预见这种反馈循环何时出现。不过,只要思考整个系统——不仅包括计算机化的部分,也包括与之互动的人——许多后果仍然可以预判。这种方法称为 系统思维(systems thinking)22。我们可以尝试理解,数据分析系统会如何响应不同的行为、结构或特征。它会巩固并放大人与人之间既有的差异,例如让富者愈富、贫者愈贫,还是会努力消除不公?而且,即使怀有最好的初衷,也必须提防意料之外的后果。
隐私与追踪
预测分析用数据自动作出关于人的决定,随之带来种种问题;除此之外,收集数据本身也存在伦理问题。收集数据的组织与数据被收集的人之间,究竟是什么关系?
如果系统只存储用户明确输入的数据,是因为用户希望它以某种方式存储和处理这些数据,那么系统就是在为用户提供服务:用户是客户。然而,如果系统只是在用户做其他事情时,顺带追踪并记录其活动,双方的关系就没有那么清楚了。服务不再只是照用户的吩咐行事,而是有了自己的利益,并且这种利益可能与用户的利益冲突。
对于许多在线服务面向用户的功能,追踪行为数据已经越来越重要:追踪用户点击了哪些搜索结果,有助于改进结果排名;推荐“喜欢 X 的人也喜欢 Y”,能帮助用户发现有趣而有用的事物;A/B 测试和用户流程分析,则能帮助判断如何改进用户界面。这些功能需要在一定程度上追踪用户行为,而用户也能从中受益。
然而,根据公司的商业模式,追踪往往不会止步于此。如果一项服务靠广告维持,广告主才是真正的客户,用户的利益便退居其次。追踪的数据越来越细,分析触及的范围越来越广,数据也会长期保留,以便为营销目的建立每个人的详细画像。
此时,公司与被收集数据的用户之间,便呈现出一种截然不同的关系。用户得到免费服务,又被诱导尽量多地参与其中;追踪用户主要不是为了服务这个人,而是为了满足出资维持服务的广告主的需求。用一个含义更阴暗的词来描述这种关系再合适不过:监视(surveillance)。
监视
让我们做一个思想实验:把 数据 一词换成 监视,再看看那些常见说法听起来是否依然悦耳 23。例如:“在我们这个监视驱动的组织中,我们收集实时监视流,并把它们存入监视仓库。我们的监视科学家运用高级分析和监视处理来获得新的洞见。”
对于《设计监视密集型应用》这本书而言,这个思想实验显得格外尖锐,甚至带有本书少见的论战色彩;但要强调这一点,就需要这样的措辞。在试图让软件“吞噬世界”的过程中 24,我们建成了人类有史以来规模最大的群体监视基础设施。我们正在迅速走近这样一个世界:每处有人居住的空间里,都至少有一个连接互联网的麦克风——智能手机、智能电视、声控助理设备、婴儿监视器,甚至使用云端语音识别的儿童玩具。许多这类设备的安全记录糟糕透顶 25。
与过去相比,新的变化在于数字化使大规模收集个人数据变得轻而易举。我们的位置与行踪、社会关系与通信、购物与支付以及健康状况,几乎都无法摆脱监视。实施监视的组织最终可能比当事人自己更了解这个人——例如,在当事人尚未察觉时,就发现其疾病或经济问题。
即使是过去最极权、最压迫的政权,也只能梦想在每个房间里装上麦克风,强迫每个人时刻携带能够追踪位置和行踪的设备。数字技术带来的好处如此之大,以至于今天的我们竟自愿接受了这个全面监视的世界。区别只在于,数据是由企业收集来为我们提供服务,而不是由试图控制我们的政府机构收集 26。
并非所有数据收集都一定称得上监视,但从监视的角度审视它,有助于理解我们与数据收集者的关系。为什么人们似乎乐于接受企业的监视?也许你觉得自己没什么可隐瞒——换句话说,你完全顺应现有的权力结构,不属于边缘化的少数群体,也不必担心遭受迫害 27。但并非人人都有这样的幸运。又或许是因为目的看起来无害:不是公然胁迫、逼人服从,只是提供更好的推荐与更个性化的营销。然而,结合上一节对预测分析的讨论,这两者之间的界线就没有那么清楚了。
我们已经看到,汽车在未经驾驶者同意的情况下追踪驾驶行为,而这些数据又会影响汽车保险费率 28;健康保险的承保条件也可能取决于人们是否佩戴健身追踪设备。当监视被用来决定保险、就业等关系人生的重要事项时,它就不再显得无害。此外,数据分析还能揭示出乎意料的私密信息:例如,智能手表或健身追踪器中的运动传感器,可以相当准确地推断你正在输入什么,甚至包括密码 29。传感器会越来越精确,分析算法也只会越来越强。
同意与选择自由
我们或许会说,用户自愿选择使用追踪其活动的服务,也接受了服务条款与隐私政策,因此已经 同意(consent)收集数据。我们甚至可以声称,用户用自己提供的数据换取了有价值的服务,而追踪是提供服务所必需的。毫无疑问,社交网络、搜索引擎以及其他各种免费在线服务的确对用户很有价值——但这种说法存在问题。
首先应该问清楚,追踪究竟在哪种意义上不可或缺。有些追踪的确直接用于改进面向用户的功能:例如,追踪搜索结果的点击率,可以提升搜索引擎的结果排名与相关性;追踪顾客经常一起购买的商品,可以帮助网店推荐相关产品。然而,如果追踪用户交互是为了推荐内容,或是为广告建立用户画像,就很难说这是否真正符合用户的利益——还是因为广告在为服务买单,追踪才变得“必要”?
其次,用户几乎不知道自己把哪些数据送进了我们的数据库,也不知道这些数据会如何保存和处理;大多数隐私政策更善于遮掩,而不是说明真相。如果不了解自己的数据将被如何处置,用户便不可能作出有意义的同意。一个用户的数据往往还会透露其他人的信息,而这些人既不是服务的用户,也没有接受任何条款。我们在本书这一部分讨论的衍生数据集,可能把整个用户群的数据与行为追踪数据、外部数据源组合起来;这恰恰是用户不可能真正理解的数据。
而且,从用户身上抽取数据是一个单向过程,既不是真正互惠的关系,也不是公平的价值交换。双方没有对话,用户也不能就提供多少数据、换取什么服务进行协商:服务与用户之间的关系高度不对称,完全是一边倒的。条件由服务制定,而不是由用户决定 30、31。
欧盟《通用数据保护条例》(GDPR)要求,同意必须是“自愿作出、具体、知情且明确无误的”;用户还必须能够“拒绝或撤回同意而不受不利影响”,否则就不能算“自愿作出”。任何征求同意的请求,都必须“采用易于理解、便于获取的形式,并使用清晰明白的语言”。此外,“沉默、预先勾选的选框或无行动均不构成同意” 32。同意并不是合法处理个人数据的唯一依据;例如,合法利益(legitimate interest)也允许出于防范欺诈等目的使用某些数据 33。
你也许会说,不愿接受监视的用户只要选择不使用这项服务即可。但这种选择同样算不上自由:如果一项服务普及到“被大多数人视为参与基本社会生活所必需” 30,就不能合理地要求人们退出这项服务——使用它实际上已成为强制要求。例如,在多数西方社会中,随身携带智能手机、通过社交网络与人交往、使用 Google 查找信息,都已经成为常态。尤其是在一项服务具有网络效应时,选择 不 使用它需要付出社会代价。
因为追踪政策而拒绝使用一项服务,说来容易,做到却很难。这些平台就是专门为吸引用户而设计的;许多平台还采用游戏机制和赌博中常见的手法,让用户不断回来 34。即使用户能够摆脱这些诱导,拒绝参与也只是少数特权者才有的选择:他们既有时间和知识去理解隐私政策,也承担得起可能错失社会交往或职业机会的代价。对于处境不那么优越的人,并不存在真正的选择自由,监视变得无从逃避。
隐私与数据使用
有时人们声称“隐私已死”,理由是一些用户愿意把生活中的种种事情发布到社交媒体上,其中有日常琐事,也有极其私密的内容。然而,这种说法是错误的,源于对 隐私(privacy)一词的误解。
拥有隐私并不意味着把一切都藏起来,而是有权自由选择向谁透露什么、公开什么、保密什么。隐私权是一种决定权:在每一种情境中,它都让每个人自行决定,要站在从保密到透明这条光谱的什么位置 30。这是个人自由与自主的重要组成部分。
例如,罹患罕见病的人也许非常乐意把自己的私密医疗数据交给研究人员,只要这些数据有望帮助开发治疗方法。关键在于,这个人可以选择谁能访问数据,以及数据用于什么目的。如果病情信息可能妨碍他们获得医疗保险、就业机会或其他重要权益,他们大概会谨慎得多。
通过监视基础设施从人们身上抽取数据时,隐私权未必遭到削弱,而是转移到了数据收集者手中。获取数据的公司实际上是在说:“相信我们会妥善使用你的数据。”这意味着,决定透露什么、保密什么的权利,从个人手中转到了公司手中。
这些公司反过来又会将大部分监视结果秘而不宣,因为公开真相会令人毛骨悚然,也会损害它们的商业模式——这种模式依靠比其他公司更了解人来获利。用户的私密信息只会间接显露出来,例如以广告定向工具的形式,供广告主锁定某类特定人群,比如患有某种疾病的人。
即使无法从某条广告所针对的人群中重新识别出某个用户,他们也已经失去了决定是否披露某些私密信息的自主权。不再是用户根据个人意愿决定向谁透露什么,而是由公司行使这项隐私权,目标则是让利润最大化。
许多公司追求的,只是不要让人 觉得 它们令人不安。它们避而不谈数据收集究竟有多么侵犯隐私,只顾管理用户的观感。可就连观感也常常管理得一团糟:例如,某件事在事实上也许没有错,但如果会唤起痛苦的回忆,用户可能根本不愿再次看到它 35。对任何数据,我们都应该预料它可能是错的、不可取的,或者在某些情境下并不合时宜,并为处理这些问题建立机制。何谓“不可取”或“不合时宜”,当然要靠人来判断;除非我们明确要求算法尊重人的需要,否则算法根本不懂这些概念。身为这些系统的工程师,我们必须保持谦逊,承认这类问题可能发生,并预先做好准备。
在线服务的隐私设置允许用户控制自己的哪些数据可以被其他用户看见。这只是把部分控制权交还给用户的起点。无论用户如何设置,服务本身仍能不受限制地访问数据,并可按照隐私政策的许可任意使用。即使服务承诺不把数据卖给第三方,通常也会赋予自己不受限制的权利,在内部处理和分析数据,而这些处理往往远远超出用户能够直接看到的范围。
如此大规模地把隐私权从个人转移给企业,在历史上前所未有 30。监视从来都有,但过去代价高昂、依赖人工,既不能自动化,也无法大规模扩展。信任关系也一直存在,例如病人与医生、被告与律师之间的关系;但在这些情形下,数据的使用受到严格的伦理、法律与监管约束。互联网服务却让人们可以在未经有效同意的情况下积累海量敏感信息,又在用户不了解私密数据去向的情况下,大规模加以利用。
数据资产与权力
行为数据是用户与服务交互的副产品,因此有时被称为“数据废气”(data exhaust),仿佛这些数据只是毫无价值的废料。从这个角度看,行为分析和预测分析就像一种回收利用,从本来会被丢弃的数据中提取价值。
更准确的看法也许恰好相反:从经济角度看,如果定向广告为服务提供收入,那么产生行为数据的用户活动就可以视为一种劳动 36。甚至还可以说,用户与之交互的应用,不过是引诱用户不断把更多个人信息送入监视基础设施的手段 30。在线服务所承载的可贵的人类创造力与社会关系,就这样被数据抽取机器无情地利用。
个人数据是宝贵的资产,数据经纪商的存在就是明证。这是一个行事隐秘、见不得光的行业:它购买、汇总、分析和推断极具侵扰性的个人数据,再将其转售,主要用于营销 20。初创公司的估值往往取决于用户数和“眼球”数量——也就是它们的监视能力。
数据既然有价值,自然有很多人想得到它。公司当然想要——这正是它们收集数据的原因。政府也想拿到这些数据:通过秘密交易、胁迫、法律强制,或者干脆窃取 37。一家公司破产时,收集的个人数据也是会被变卖的资产之一。而且,数据很难保护周全,泄露事件频繁得令人不安。
这些现象使批评者认为,数据不仅是一种资产,更是一种“有毒资产” 37,至少也是“危险物质” 38。数据或许不是什么“新黄金”或“新石油”,而是“新铀” 39。即使自信能够防止数据遭到滥用,每次收集数据时,我们仍需权衡它的好处与落入恶人之手的风险:计算机系统可能被罪犯或敌对国家的情报机构攻破;数据可能被内鬼泄露;公司可能落入不认同我们价值观、不择手段的管理层手中;国家也可能被一个强迫我们交出数据时毫无顾忌的政权接管。
收集数据时,我们不能只考虑今天的政治环境,还必须考虑未来所有可能出现的政府。没有人能保证今后当选的每一届政府都会尊重人权与公民自由;因此,“部署日后可能助长警察国家的技术,有违健全的公民社会规范” 40。
俗话说,“知识就是力量”。不仅如此,“审视他人而让自己免受审视,是最重要的权力形式之一” 41。这正是极权政府渴求监视的原因:它赋予政府控制民众的力量。今天的科技公司虽然没有公开谋求政治权力,但积累的数据与知识仍然赋予它们左右我们生活的巨大力量;其中很大一部分都在暗中发挥作用,不受公众监督 42。
回顾工业革命
数据是信息时代的决定性特征。互联网、数据存储与处理,以及软件驱动的自动化,正在深刻影响全球经济与人类社会。信息技术已经改变了我们的日常生活和社会组织,并且很可能在未来几十年继续带来根本变化,这自然让人联想到工业革命 17、26。
工业革命源于技术与农业的重大进步,带来了持续的经济增长,长远来看也显著提高了生活水平。然而,它同样伴随着严重问题:烟尘和化工过程造成可怕的空气污染,工业与生活废弃物也严重污染水源。工厂主生活奢华,城市工人却往往居住在简陋的房屋中,长时间在恶劣条件下劳动。雇用童工十分普遍,甚至让儿童在矿井中从事危险而低薪的工作。
人们花了很长时间,才建立起环境保护法规、工作场所安全规程、童工禁令和食品卫生检查等保障措施。工厂不能再把废料排入河流、出售受污染的食品或剥削工人,经营成本无疑会随之上升。然而,整个社会从这些法规中受益匪浅,今天几乎没有人愿意回到它们出现之前的年代 17。
正如工业革命有着必须治理的黑暗面,迈向信息时代的过程也带来了我们必须正视并解决的重大问题 43、44。数据的收集与使用就是其中之一。用 Bruce Schneier 的话来说 26:
数据是信息时代的污染问题,保护隐私则是环境挑战。几乎所有计算机都会产生信息。它堆积在周围,开始溃烂。如何处理它——如何控制它,又如何处置它——是信息经济健康发展的核心。今天,我们回望工业时代最初的几十年,会疑惑祖先为何在急于建设工业世界时无视污染;同样,我们的后代也会回望信息时代最初的几十年,并根据我们如何应对数据收集与滥用的挑战来评价我们。
我们应该努力让他们感到骄傲。
立法与自律
数据保护法或许能够帮助维护个人权利。例如,欧盟 GDPR 规定,个人数据必须“为特定、明确且合法的目的而收集,不得以与这些目的不相容的方式作进一步处理”;而且,数据必须“相对于处理目的而言充分、相关,并仅限于必要范围” 32。
然而,数据最小化(data minimization)原则与大数据的哲学针锋相对。大数据追求尽可能多地收集数据,将其与其他数据集组合,通过实验和探索获得新的洞见。探索意味着把数据用于未曾预料的目的,这恰好与收集数据时必须声明的“特定、明确”目的相反。GDPR 虽然给在线广告行业带来了一些影响 45,执行力度却一直很弱 46,而且似乎没有促使整个科技行业的文化与实践发生多大改变。
收集大量个人数据的公司反对监管,认为它会增加负担、妨碍创新。这种反对在一定程度上不无道理。例如,共享医疗数据显然会带来隐私风险,却也蕴藏着机会:如果数据分析能帮助我们改进诊断、找到更好的治疗方法,可以挽救多少生命 47?监管过度也许会阻碍这类突破。要在潜在机会与风险之间找到平衡并不容易 41。
归根结底,科技行业对待个人数据的文化必须改变。我们应该停止把用户视为有待优化的指标,记住他们是值得尊重、拥有尊严和自主权的人。我们应该自觉约束收集与处理数据的做法,建立并维系依赖我们软件的人们对我们的信任 48。我们也有责任让终端用户了解其数据如何被使用,而不是继续把他们蒙在鼓里。
我们应该让每个人保有隐私——也就是对自己数据的控制权——而不是用监视手段把这种控制权夺走。个人控制自身数据的权利,就像国家公园里的自然环境:如果我们不明确地保护、照料它,它就会遭到破坏。这将成为一场公地悲剧,最终所有人都会受害。无处不在的监视并非不可避免,我们仍然来得及阻止它。
第一步是不要永久保留数据,而要在不再需要时尽快清除,并从一开始就尽量少收集 48、49。手中没有的数据,就不可能泄露、被盗,也不可能被政府强迫交出。总的来说,我们必须改变文化与态度。身为技术从业者,如果不考虑自己工作的社会影响,就是没有尽到本职 50。
总结
至此,我们来到了全书的终点。这一路讨论了许多内容:
在 第 1 章 中,我们对比了分析型系统与事务型系统、云服务与自托管、分布式系统与单节点系统,并讨论了如何在业务需求与用户需求之间取得平衡。
在 第 2 章 中,我们介绍了如何定义性能、可靠性、可伸缩性和可维护性等非功能性需求。
在 第 3 章 中,我们考察了关系模型、文档模型、图模型、事件溯源和数据框等一系列数据模型,还介绍了 SQL、Cypher、SPARQL、Datalog 与 GraphQL 等查询语言的示例。
在 第 4 章 中,我们讨论了用于 OLTP 的存储引擎(LSM 树和 B 树)、用于分析的列式存储,以及用于信息检索的全文索引与向量索引。
在 第 5 章 中,我们考察了将数据对象编码为字节的不同方式,以及如何随着需求变化支持演化。我们还比较了数据通过数据库、服务调用、工作流引擎和事件驱动架构在进程之间流动的几种方式。
在 第 6 章 中,我们研究了单主复制、多主复制与无主复制之间的权衡,也讨论了写后读一致性等一致性模型,以及让客户端可以离线工作的同步引擎。
在 第 7 章 中,我们深入讨论了分片,包括再平衡策略、请求路由和二级索引。
在 第 8 章 中,我们讨论了事务的持久性、读已提交、快照隔离和可串行化等隔离级别的实现方式,以及如何保证分布式事务的原子性。
在 第 9 章 中,我们梳理了分布式系统中的根本问题,包括网络故障与延迟、时钟误差、进程暂停和崩溃,并看到这些问题为何让正确实现一把看似简单的锁都变得十分困难。
在 第 10 章 中,我们详细讨论了各种形式的共识,以及共识所实现的一致性模型——线性一致性。
在 第 11 章 中,我们深入研究了批处理,从简单的 Unix 工具链,一直讲到使用分布式文件系统或对象存储的大规模分布式批处理器。
在 第 12 章 中,我们把批处理推广为流处理,并讨论了底层消息代理、变更数据捕获、容错,以及流连接等处理模式。
在 第 13 章 中,我们探讨了一套流式系统的哲学,使彼此不同的数据系统更容易集成、系统更容易演化,应用也更容易伸缩。
最后,在本章中,我们退后一步,审视了构建数据密集型应用所涉及的一些伦理问题。我们看到,数据虽然可以用来行善,也可能造成严重伤害:作出深刻影响个人生活、却难以申诉的决定,导致歧视与剥削,让监视成为常态,并暴露私密信息。我们还面临数据泄露的风险;即使出于善意使用数据,也可能造成意料之外的后果。
软件和数据正在给世界带来如此巨大的影响。身为工程师,我们必须牢记,自己有责任为希望生活其中的世界而努力——一个怀着人性与尊重对待每个人的世界。让我们一起朝着这个目标前进。
脚注
参考文献
David Schmudde. What If Data Is a Bad Idea?. schmud.de, August 2024. Archived at perma.cc/ZXU5-XMCT ↩︎
ACM Code of Ethics and Professional Conduct. Association for Computing Machinery, acm.org, 2018. Archived at perma.cc/SEA8-CMB8 ↩︎
Igor Perisic. Making Hard Choices: The Quest for Ethics in Machine Learning. linkedin.com, November 2016. Archived at perma.cc/DGF8-KNT7 ↩︎
John Naughton. Algorithm Writers Need a Code of Conduct. theguardian.com, December 2015. Archived at perma.cc/TBG2-3NG6 ↩︎
Ben Green. “Good” isn’t good enough. At NeurIPS Joint Workshop on AI for Social Good, December 2019. Archived at perma.cc/H4LN-7VY3 ↩︎
Deborah G. Johnson and Mario Verdicchio. Ethical AI is Not about AI. Communications of the ACM, volume 66, issue 2, pages 32–34, January 2023. doi:10.1145/3576932 ↩︎
Marc Steen. Ethics as a Participatory and Iterative Process. Communications of the ACM, volume 66, issue 5, pages 27–29, April 2023. doi:10.1145/3550069 ↩︎
Logan Kugler. What Happens When Big Data Blunders? Communications of the ACM, volume 59, issue 6, pages 15–16, June 2016. doi:10.1145/2911975 ↩︎
Miri Zilka. Algorithms and the criminal justice system: promises and challenges in deployment and research. At University of Cambridge Security Seminar Series, March 2023. ↩︎
Bill Davidow. Welcome to Algorithmic Prison. theatlantic.com, February 2014. Archived at archive.org ↩︎
Don Peck. They’re Watching You at Work. theatlantic.com, December 2013. Archived at perma.cc/YR9T-6M38 ↩︎
Leigh Alexander. Is an Algorithm Any Less Racist Than a Human? theguardian.com, August 2016. Archived at perma.cc/XP93-DSVX ↩︎
Jesse Emspak. How a Machine Learns Prejudice. scientificamerican.com, December 2016. perma.cc/R3L5-55E6 ↩︎
Rohit Chopra, Kristen Clarke, Charlotte A. Burrows, and Lina M. Khan. Joint Statement on Enforcement Efforts Against Discrimination and Bias in Automated Systems. ftc.gov, April 2023. Archived at perma.cc/YY4Y-RCCA ↩︎
Maciej Cegłowski. The Moral Economy of Tech. idlewords.com, June 2016. Archived at perma.cc/L8XV-BKTD ↩︎
Greg Nichols. Artificial Intelligence in healthcare is racist. zdnet.com, November 2020. Archived at perma.cc/3MKW-YKRS ↩︎
Cathy O’Neil. Weapons of Math Destruction: How Big Data Increases Inequality and Threatens Democracy. Crown Publishing, 2016. ISBN: 978-0-553-41881-1 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
Julia Angwin. Make Algorithms Accountable. nytimes.com, August 2016. Archived at archive.org ↩︎
Bryce Goodman and Seth Flaxman. European Union Regulations on Algorithmic Decision-Making and a ‘Right to Explanation’. At ICML Workshop on Human Interpretability in Machine Learning, June 2016. Archived at arxiv.org/abs/1606.08813 ↩︎
A Review of the Data Broker Industry: Collection, Use, and Sale of Consumer Data for Marketing Purposes. Staff Report, United States Senate Committee on Commerce, Science, and Transportation, commerce.senate.gov, December 2013. Archived at perma.cc/32NV-YWLQ ↩︎ ↩︎
Stephanie Assad, Robert Clark, Daniel Ershov, and Lei Xu. Algorithmic Pricing and Competition: Empirical Evidence from the German Retail Gasoline Market. Journal of Political Economy, volume 132, issue 3, pages 723-771, March 2024. doi:10.1086/726906 ↩︎
Donella H. Meadows and Diana Wright. Thinking in Systems: A Primer. Chelsea Green Publishing, 2008. ISBN: 978-1-603-58055-7 ↩︎
Daniel J. Bernstein. Listening to a “big data”/“data science” talk. Mentally translating “data” to “surveillance”: “...everything starts with surveillance...” x.com, May 2015. Archived at perma.cc/EY3D-WBBJ ↩︎
Marc Andreessen. Why Software Is Eating the World. a16z.com, August 2011. Archived at perma.cc/3DCC-W3G6 ↩︎
J. M. Porup. ‘Internet of Things’ Security Is Hilariously Broken and Getting Worse. arstechnica.com, January 2016. Archived at archive.org ↩︎
Bruce Schneier. Data and Goliath: The Hidden Battles to Collect Your Data and Control Your World. W. W. Norton, 2015. ISBN: 978-0-393-35217-7 ↩︎ ↩︎ ↩︎
The Grugq. Nothing to Hide. grugq.tumblr.com, April 2016. Archived at perma.cc/BL95-8W5M ↩︎
Federal Trade Commission. FTC Takes Action Against General Motors for Sharing Drivers’ Precise Location and Driving Behavior Data Without Consent. ftc.gov, January 2025. Archived at perma.cc/3XGV-3HRD ↩︎
Tony Beltramelli. Deep-Spying: Spying Using Smartwatch and Deep Learning. Masters Thesis, IT University of Copenhagen, December 2015. Archived at arxiv.org/abs/1512.05616 ↩︎
Shoshana Zuboff. Big Other: Surveillance Capitalism and the Prospects of an Information Civilization. Journal of Information Technology, volume 30, issue 1, pages 75–89, April 2015. doi:10.1057/jit.2015.5 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
Michiel Rhoen. Beyond Consent: Improving Data Protection Through Consumer Protection Law. Internet Policy Review, volume 5, issue 1, March 2016. doi:10.14763/2016.1.404 ↩︎
Regulation (EU) 2016/679 of the European Parliament and of the Council of 27 April 2016. Official Journal of the European Union, L 119/1, May 2016. ↩︎ ↩︎
UK Information Commissioner’s Office. What is the ’legitimate interests’ basis? ico.org.uk. Archived at perma.cc/W8XR-F7ML ↩︎
Tristan Harris. How a handful of tech companies control billions of minds every day. At TED2017, April 2017. ↩︎
Carina C. Zona. Consequences of an Insightful Algorithm. At GOTO Berlin, November 2016. ↩︎
Imanol Arrieta Ibarra, Leonard Goff, Diego Jiménez Hernández, Jaron Lanier, and E. Glen Weyl. Should We Treat Data as Labor? Moving Beyond ‘Free’. American Economic Association Papers Proceedings, volume 1, issue 1, December 2017. ↩︎
Bruce Schneier. Data Is a Toxic Asset, So Why Not Throw It Out? schneier.com, March 2016. Archived at perma.cc/4GZH-WR3D ↩︎ ↩︎
Cory Scott. Data is not toxic - which implies no benefit - but rather hazardous material, where we must balance need vs. want. x.com, March 2016. Archived at perma.cc/CLV7-JF2E ↩︎
Mark Pesce. Data is the new uranium – incredibly powerful and amazingly dangerous. theregister.com, November 2024. Archived at perma.cc/NV8B-GYGV ↩︎
Bruce Schneier. Mission Creep: When Everything Is Terrorism. schneier.com, July 2013. Archived at perma.cc/QB2C-5RCE ↩︎
Lena Ulbricht and Maximilian von Grafenstein. Big Data: Big Power Shifts? Internet Policy Review, volume 5, issue 1, March 2016. doi:10.14763/2016.1.406 ↩︎ ↩︎
Ellen P. Goodman and Julia Powles. Facebook and Google: Most Powerful and Secretive Empires We’ve Ever Known. theguardian.com, September 2016. Archived at perma.cc/8UJA-43G6 ↩︎
Judy Estrin and Sam Gill. The World Is Choking on Digital Pollution. washingtonmonthly.com, January 2019. Archived at perma.cc/3VHF-C6UC ↩︎
A. Michael Froomkin. Regulating Mass Surveillance as Privacy Pollution: Learning from Environmental Impact Statements. University of Illinois Law Review, volume 2015, issue 5, August 2015. Archived at perma.cc/24ZL-VK2T ↩︎
Pengyuan Wang, Li Jiang, and Jian Yang. The Early Impact of GDPR Compliance on Display Advertising: The Case of an Ad Publisher. Journal of Marketing Research, volume 61, issue 1, April 2023. doi:10.1177/00222437231171848 ↩︎
Johnny Ryan. Don’t be fooled by Meta’s fine for data breaches. The Economist, May 2023. Archived at perma.cc/VCR6-55HR ↩︎
Jessica Leber. Your Data Footprint Is Affecting Your Life in Ways You Can’t Even Imagine. fastcompany.com, March 2016. Archived at archive.org ↩︎
Maciej Cegłowski. Haunted by Data. idlewords.com, October 2015. Archived at archive.org ↩︎ ↩︎
Sam Thielman. You Are Not What You Read: Librarians Purge User Data to Protect Privacy. theguardian.com, January 2016. Archived at archive.org ↩︎
Jez Humble. It’s a cliché that people get into tech to “change the world”. So then, you have to actually consider what the impact of your work is on the world. The idea that you can or should exclude societal and political discussions in tech is idiotic. It means you’re not doing your job. x.com, April 2021. Archived at perma.cc/3NYS-MHLC ↩︎