两年前,声音克隆需要数十小时的训练音频和数十万美元的计算资源。如今,消费级服务可以从五分钟的清晰录音中合成一个可识别的声音。在人工智能辅助记忆保存领域,变化的速度确实令人迷惑——即使是在这个领域工作的人员也是如此。
这是一份领域报告,不是产品评测。我们是在这个类别中运营的服务之一,这意味着我们有一个明显的观点。我们在这里尝试写的是一个诚实的评估,关于实际改进了什么,什么仍然真的很难,以及对于试图使用这些工具的家庭来说,新出现的问题是什么。
自2024年以来实际改进的地方
声音合成质量
合成声音与录制声音之间的差距已经显著缩小。在2023年,人工智能生成的声音有一个特征性的平坦感——情感范围的压缩听起来在长时间聆听时显得不自然。到了2025年中,ElevenLabs、OpenAI和几家较小的供应商的模型已经将这种平坦感减少到随意听众不能再可靠地区分合成声音和真实声音在短片段中的程度。
这对家庭记忆的影响是真实的。一个基于你祖父75岁时录音的声音模型现在可以阅读文本,讲述照片上的字幕,或者以他真正的声音传递手写的信件。技术已经存在。即使能力已经成熟,围绕部署它的伦理和同意问题在行业层面上还没有得到解决。
人工智能辅助回忆录结构
大型语言模型在回忆录写作的结构层面上变得真正有用。给定从录制的访谈中得到的原始转录,当前的模型可以组织片段成连贯的叙述,识别主题线索,建议过渡段落,并标记时间线上的空白。它们仍然做得不好的是具体细节——城镇的名字,确切的年份,厨房的味道描述——这些只能来自主题本身。
实际的结果:人工智能现在是一个可信的编辑层,而不是原始录音的替代品。如果你有几个小时的原始访谈,人工智能可以帮助将其塑造成可读的东西。它不能发明不存在的东西。
多模态保存
声音、图像、视频和文本整合到统一档案中的整合已经大大改进。以前将媒体隔离的服务已经转向链接档案——你祖母谈论一张照片的录音现在可以存储,以便照片和录音一起出现,附带一个转录本。这听起来是渐进的。对于处理大型、无组织的档案的家庭来说,这是变革性的。
没有改进的地方
同意框架
行业中最大的滞后不是技术性的——而是伦理性的。大多数在这个领域运营的服务仍然依赖家庭成员或遗产来授权声音克隆和个人数据的死后使用,而不是主题本身的明确同意。这不是对任何特定公司的批评。这是一个关于整个类别的规范尚未转变的观察,尽管公众对风险的意识增加了。
实际的后果:如果你使用一个不需要主题自己录制同意的服务,你正在代表某人做出决定,他们可能不同意。在你的家庭中,这可能没问题。它也可能产生冲突、内疚或法律复杂性,直到几年后才变得明显。
对话人工智能中的幻觉
最商业化的类别——基于死者录音的对话人工智能——也是存在最未解决的问题的类别。附加到声音模型的LLM将生成对主题从未涉及的问题的合理听起来的回应。输出听起来是真实的。它不是真实的。它是模型对主题可能说了什么的插值,穿着主题的声音。
对于处于急性悲伤中的家庭来说,这种区别可能真的很难把握。2025年发表的几项同行评审的心理学研究已经开始检查这项技术的悲伤影响,早期证据表明,对话人工智能祖先可能会使健康哀悼变得复杂而不是支持——特别是对于儿童和与死者有复杂关系的人。
这项技术没有解决这个问题。它放大了它。
每个家庭在选择服务之前应该问的问题
无论你使用我们的服务还是别人的服务——这些问题应该决定你是否信任他们处理这种不可替代的东西:
- 谁同意了?是主题自己授权这项服务,还是家庭成员代表他们做决定?
- 如果公司关闭或被收购,数据会发生什么?这是一个创业公司众多的类别。“我们还没有政策”的答案是不可以接受的。
- 人工智能输出是否标记?当档案中的某物是人工智能生成的与直接来自主题的,是否清楚地标记?
- 声音模型是否用于任何训练数据?即使答案是“匿名的”,也要追问具体细节。
- 任何家庭成员可以随时撤销吗?还是需要家庭达成共识——一个在复杂家庭中崩溃的过程,这几乎是大多数家庭。
我们认为这将走向何方
这项技术将继续比围绕它的伦理框架更快地改进。这是这个类别的性质。在未来24个月内区分服务的不是技术能力——而是围绕能力的同意和访问架构的严谨性。
将最受益于这项技术的家庭是那些在他们所爱的人还活着的时候捕捉原始、真实的录音的家庭——并使用人工智能作为组织和扩展这些录音的工具,而不是替代它们。
人工智能不能做的最重要的事情是取代你还没有进行的对话。去进行它。
“技术是容易的部分。困难的部分是确保人们想要以这种方式被记住。”
— 詹姆斯·卢里博士,爱丁堡大学,2025年数字遗产会议