使用指南

dicto 会把你所说或所输入的内容显示为又大又清晰的文字。本指南介绍该应用的工作方式。

目录

快速开始

首次启动 dicto 时,会先经过简短的引导流程,从中选择默认的说话语言和配色方案。两者都可以随时在设置中更改。这些偏好设置屏幕之后是三个介绍应用功能的基本说明屏幕,可以跳过。

首次按下麦克风按钮时,iOS 会显示访问权限屏幕,请求访问你设备上的语音识别和麦克风。这两项都是 Apple 服务,dicto 需要它们才能把你的话语显示为文字。请点按“允许”;若要之后再启用访问权限,请打开 iOS 设置应用,前往设置 ▸ dicto,然后开启麦克风语音识别

主屏幕

主屏幕显示当前消息以及用于创建、清除和重新查看消息的控件。竖屏方向显示的文字略大(适合较短的消息),横屏方向显示更长的文字(适合稍长或带有上下文的消息)。

说话与听写

点按麦克风按钮或在消息显示区连点两下即可开始听写。正常说话即可,文字会随着你的话语出现。如果听写效果不佳(句子无法正确结束),设置菜单中针对说话较快或较慢者的说话速度设置可能会有帮助。

默认情况下,约一秒的停顿会结束一个句子,接着 dicto 会加上句号或问号并继续聆听。约两秒的停顿会结束当前的发言,并显示最终文字;超出主屏幕下方的消息会自动滚动。消息也可以手动滚动,并且可以在设置菜单中关闭自动滚动。可在设置说话速度中调整 dicto 在停顿处等待的时长。Solo 会话约一分半钟后会自动停止,以免麦克风在嘈杂的房间里一直开着。Solo 的句子计时同样由说话速度设置决定。

听写由 Apple 的语音识别提供,并不完美。口音、背景噪音、不常见的名字、非常短的短语,以及多人同时说话,都可能被听错。以自然的语速清晰地说话,并使用与说话者相匹配的说话速度设置,效果最好。

要清除屏幕上的文字,请按屏幕底部的清除。按住清除会弹出开始新的对话?对话框。按重新开始可重置 dicto,并清空之前区域。

Solo

Solo 通过人声分离技术让 dicto 专注于一个已登记的声音,旨在显示该说话者的话语,并忽略附近的其他声音。Solo 支持无需动手的操作方式。其他声音的话语不会显示,也绝不会被转写。Solo 在安静至中等嘈杂的房间里、每次只有一人说话时效果最好;当 dicto 无法确定某个声音是否为已登记的声音时,它不会显示任何内容。快速说出的三个词以内的短语可能太短而无法识别(例如“Hello”“That's great”),可能不会出现在屏幕上。

Solo 的工作方式

Solo 处于活动状态时,dicto 会聆听房间里的声音,并把每一段话语转换成一组描述音色而非词句的少量数字。这些数字会与登记时采集的数字进行比对。与已登记声音相匹配的话语会被转写并显示;不匹配的话语会被丢弃,绝不会被转换成文字。比对由应用内置、完全在设备上运行的小型机器学习模型完成;不涉及任何云服务、账户或网络连接。任何话语都绝不会被保存或录制。

登记声音

  1. 按住麦克风按钮并自然地说话。按住期间你所说的内容会作为普通消息显示。
  2. 面板会显示登记进度。在采集到足以进行基本区分的声音之前,进度条为红色。
  3. 实际说话约三秒后,进度条变为黄色并发出提示音:基本登记已成功,此时可以随时松开按钮。
  4. 继续按住按钮可以改善登记效果,实际说话最多十秒即可完成完整登记。随着采集到更多声音,进度条会从黄色渐变为绿色,约十秒时变为绿色。完整登记会以 Solo Glow(一种全屏光晕效果)来表示。
  5. 松开按钮。Solo 便开始聆听已登记的声音。登记成功时,麦克风图标会变成 Solo 图标:一个带声波条纹的人物图标,外围是实线青色圆环。

如果松开按钮时采集到的声音太少,dicto 会再聆听约两秒;若仍无法完成登记,则会取消本次登记。

登记补充与 Solo Glow

基本登记就足以开始使用,dicto 会自行悄悄把余下的工作做完。会话进行期间,与已登记声音明确相符的话语片段会被加入登记,随着对话继续提升准确度。这称为登记补充;它只使用已登记的声音,绝不使用其他话语。当登记达到完整规模时,无论是通过按住按钮直到进度条变绿,还是通过对话中的补充,Solo Glow 都会出现:一次短暂、无声的全屏光晕,表示 dicto 已完整登记该声音。它出现时无需做任何操作。

会话进行期间

已登记的声音会按说话速度的计时逐条显示消息。其他声音在屏幕上不会产生任何内容。Solo 会话进行期间,之前会被隐藏。点按麦克风按钮可暂停或继续聆听;房间内约三十秒无声后,会话也会自行暂停。Solo 会话暂停时,实线的青色圆环会变成虚线。要重新激活当前会话,请点按 Solo 按钮。

结束会话

按住清除按钮并确认重新开始,即可抹除当前文字和已登记的声音;随后会出现短暂的“对话已清除”提示,确认抹除完成。约三分钟内未出现已登记的声音,或应用被切换到后台时,会话也会自行结束。在会话进行期间按住麦克风按钮,可登记另一个声音来取代已登记的声音。

声音特征档案

声音匹配由应用内置、完全在你设备上运行的小型机器学习模型完成。其中不涉及任何云服务、账户或网络连接;这些模型只做声音比对,仅此而已。登记本身是一组用于区分声音的少量数字,仅在会话期间保存在内存中:绝不写入存储,绝不发送到任何地方,会话结束即消失。

声音匹配模型为 pyannote community-1 说话人模型(WeSpeaker 系列),由 FluidInference 转换为 Core ML,并依据 Creative Commons Attribution 4.0 许可使用。

输入

点按键盘按钮打开输入文字。输入或粘贴消息,然后点按完成(或按键盘上的蓝色对勾按钮)将其显示在主屏幕上,或点按取消关闭而不更改当前消息。

低语模式

低语模式用于开启或关闭消息消失功能。在设置中开启低语模式即可发送 Wisps:会出现在屏幕上、停留几秒钟、随后永久消失的消息。Wisps 绝不会保存到之前,且在低语模式开启期间,之前会被隐藏。低语模式开启期间,自动滚动也会关闭。

朗读

点按右上角的朗读按钮,即可将当前显示的消息朗读出来。屏幕上没有消息时,该按钮不可用。朗读所用的语音在设置语音中设定;可在 iOS 设置应用的辅助功能 ▸ 朗读内容 ▸ 声音中添加更多语音(不是 Siri)。

设置

点按设置按钮(左上角的齿轮)打开设置菜单。

隐私与数据

dicto 在你的设备上处理一切。你所说或所输入的内容都不会发送给我们,关闭应用后也不会保存任何内容。完整详情请参见隐私政策

支持

有疑问、遇到问题或想提供反馈?欢迎来信 support@speechdisplay.com,我们很乐意帮忙。

返回首页