使用指南
dicto 会把你所说或所输入的内容显示为又大又清晰的文字。本指南介绍该应用的工作方式。
目录
快速开始
首次启动 dicto 时,会先经过简短的引导流程,从中选择默认的说话语言和配色方案。两者都可以随时在设置中更改。这些偏好设置屏幕之后是三个介绍应用功能的基本说明屏幕,可以跳过。
首次按下麦克风按钮时,iOS 会显示访问权限屏幕,请求访问你设备上的语音识别和麦克风。这两项都是 Apple 服务,dicto 需要它们才能把你的话语显示为文字。请点按“允许”;若要之后再启用访问权限,请打开 iOS 设置应用,前往设置 ▸ dicto,然后开启麦克风和语音识别。
主屏幕
主屏幕显示当前消息以及用于创建、清除和重新查看消息的控件。竖屏方向显示的文字略大(适合较短的消息),横屏方向显示更长的文字(适合稍长或带有上下文的消息)。
- 消息显示区:显示屏幕上的操作提示和当前消息,在可用空间允许的范围内尽量放大,并在你说话时实时更新。在该区域连点两下可开始或停止听写。长按可编辑当前消息。较长的消息会自动滚动;可在设置中改为手动滚动。
- 麦克风按钮:开始或停止一条语音消息。请参阅说话与听写。按住可在 Solo 中开始登记。
- 键盘按钮:打开键盘以输入或粘贴消息,而不是说话。参见输入。
- 清除按钮:清除当前消息。被清除的消息不会保存到之前。长按清除按钮会弹出“开始新的对话?”对话框,该操作会重置应用。
- 之前:屏幕底部一排已完成的消息。开始新消息时,未清除的消息会加入之前区域。点按某条消息可再次显示它。关闭应用后之前会被清空,且在低语模式开启或 Solo 会话进行期间处于非活动状态。
- 朗读按钮:使用在设置中所选的语音朗读当前消息。参见朗读。
- 设置按钮:打开设置屏幕,可在其中设置语言、配色方案、说话速度和低语模式等偏好。参见设置。
说话与听写
点按麦克风按钮或在消息显示区连点两下即可开始听写。正常说话即可,文字会随着你的话语出现。如果听写效果不佳(句子无法正确结束),设置菜单中针对说话较快或较慢者的说话速度设置可能会有帮助。
默认情况下,约一秒的停顿会结束一个句子,接着 dicto 会加上句号或问号并继续聆听。约两秒的停顿会结束当前的发言,并显示最终文字;超出主屏幕下方的消息会自动滚动。消息也可以手动滚动,并且可以在设置菜单中关闭自动滚动。可在设置的说话速度中调整 dicto 在停顿处等待的时长。Solo 会话约一分半钟后会自动停止,以免麦克风在嘈杂的房间里一直开着。Solo 的句子计时同样由说话速度设置决定。
听写由 Apple 的语音识别提供,并不完美。口音、背景噪音、不常见的名字、非常短的短语,以及多人同时说话,都可能被听错。以自然的语速清晰地说话,并使用与说话者相匹配的说话速度设置,效果最好。
要清除屏幕上的文字,请按屏幕底部的清除。按住清除会弹出开始新的对话?对话框。按重新开始可重置 dicto,并清空之前区域。
Solo
Solo 通过人声分离技术让 dicto 专注于一个已登记的声音,旨在显示该说话者的话语,并忽略附近的其他声音。Solo 支持无需动手的操作方式。其他声音的话语不会显示,也绝不会被转写。Solo 在安静至中等嘈杂的房间里、每次只有一人说话时效果最好;当 dicto 无法确定某个声音是否为已登记的声音时,它不会显示任何内容。快速说出的三个词以内的短语可能太短而无法识别(例如“Hello”“That's great”),可能不会出现在屏幕上。
Solo 的工作方式
Solo 处于活动状态时,dicto 会聆听房间里的声音,并把每一段话语转换成一组描述音色而非词句的少量数字。这些数字会与登记时采集的数字进行比对。与已登记声音相匹配的话语会被转写并显示;不匹配的话语会被丢弃,绝不会被转换成文字。比对由应用内置、完全在设备上运行的小型机器学习模型完成;不涉及任何云服务、账户或网络连接。任何话语都绝不会被保存或录制。
登记声音
- 按住麦克风按钮并自然地说话。按住期间你所说的内容会作为普通消息显示。
- 面板会显示登记进度。在采集到足以进行基本区分的声音之前,进度条为红色。
- 实际说话约三秒后,进度条变为黄色并发出提示音:基本登记已成功,此时可以随时松开按钮。
- 继续按住按钮可以改善登记效果,实际说话最多十秒即可完成完整登记。随着采集到更多声音,进度条会从黄色渐变为绿色,约十秒时变为绿色。完整登记会以 Solo Glow(一种全屏光晕效果)来表示。
- 松开按钮。Solo 便开始聆听已登记的声音。登记成功时,麦克风图标会变成 Solo 图标:一个带声波条纹的人物图标,外围是实线青色圆环。
如果松开按钮时采集到的声音太少,dicto 会再聆听约两秒;若仍无法完成登记,则会取消本次登记。
登记补充与 Solo Glow
基本登记就足以开始使用,dicto 会自行悄悄把余下的工作做完。会话进行期间,与已登记声音明确相符的话语片段会被加入登记,随着对话继续提升准确度。这称为登记补充;它只使用已登记的声音,绝不使用其他话语。当登记达到完整规模时,无论是通过按住按钮直到进度条变绿,还是通过对话中的补充,Solo Glow 都会出现:一次短暂、无声的全屏光晕,表示 dicto 已完整登记该声音。它出现时无需做任何操作。
会话进行期间
已登记的声音会按说话速度的计时逐条显示消息。其他声音在屏幕上不会产生任何内容。Solo 会话进行期间,之前会被隐藏。点按麦克风按钮可暂停或继续聆听;房间内约三十秒无声后,会话也会自行暂停。Solo 会话暂停时,实线的青色圆环会变成虚线。要重新激活当前会话,请点按 Solo 按钮。
结束会话
按住清除按钮并确认重新开始,即可抹除当前文字和已登记的声音;随后会出现短暂的“对话已清除”提示,确认抹除完成。约三分钟内未出现已登记的声音,或应用被切换到后台时,会话也会自行结束。在会话进行期间按住麦克风按钮,可登记另一个声音来取代已登记的声音。
声音特征档案
声音匹配由应用内置、完全在你设备上运行的小型机器学习模型完成。其中不涉及任何云服务、账户或网络连接;这些模型只做声音比对,仅此而已。登记本身是一组用于区分声音的少量数字,仅在会话期间保存在内存中:绝不写入存储,绝不发送到任何地方,会话结束即消失。
声音匹配模型为 pyannote community-1 说话人模型(WeSpeaker 系列),由 FluidInference 转换为 Core ML,并依据 Creative Commons Attribution 4.0 许可使用。
输入
点按键盘按钮打开输入文字。输入或粘贴消息,然后点按完成(或按键盘上的蓝色对勾按钮)将其显示在主屏幕上,或点按取消关闭而不更改当前消息。
低语模式
低语模式用于开启或关闭消息消失功能。在设置中开启低语模式即可发送 Wisps:会出现在屏幕上、停留几秒钟、随后永久消失的消息。Wisps 绝不会保存到之前,且在低语模式开启期间,之前会被隐藏。低语模式开启期间,自动滚动也会关闭。
朗读
点按右上角的朗读按钮,即可将当前显示的消息朗读出来。屏幕上没有消息时,该按钮不可用。朗读所用的语音在设置的语音中设定;可在 iOS 设置应用的辅助功能 ▸ 朗读内容 ▸ 声音中添加更多语音(不是 Siri)。
设置
点按设置按钮(左上角的齿轮)打开设置菜单。
- 低语模式:开启或关闭消息消失功能。参见低语模式。
- 说话速度:快、中等或慢。调整 dicto 在停顿处等待多久以结束句子或消息。如果句子不分开,请设为快;如果句子被截断,请设为慢。
- Solo 声音匹配:严格、均衡或宽松。调整声音需要与已登记的声音多接近才会在 Solo 中显示。从下次登记起生效。房间里的声音听起来相似时,请选择严格。
- 对话距离(仅限 iPad):为近距离(较小字体)和远距离(较大字体)对话调整字体大小。
- 自动滚动长消息:开启后,长消息会以易读的速度自动滚动到末尾再返回;关闭即停止自动滚动消息。消息始终可以手动滚动。
- 打开时的输入:语音会让 dicto 在打开时进入聆听模式以接收第一条消息,如同一位快速的对话伙伴;手动则以常规界面打开 dicto,允许以语音或文字输入第一条消息。
- 语音:用于朗读的语音。
- 配色方案:选择偏好的显示颜色。提供系统、浅色和深色选项,以及多种高对比组合:白底黑字、黑底白字、蓝底黄字、黑底绿字、黑底橙字、白底深红字、黑底霓虹粉字,以及绿底白字。每种颜色组合都符合 WCAG AA 无障碍对比度标准,在 dicto 显示的大字号下,每种组合都达到 AAA。
- 语言:你为听写所说的语言(不是应用的界面语言)。dicto 支持 50 多种口语,取自 Apple 的设备端听写。只要设备支持,任何语言都可以选用,与用户界面语言无关(例如,可以在英文界面的应用中使用中文听写)。请参阅听写语言列表。dicto 界面本身提供 14 种语言;请参阅界面语言。
- 关于 dicto:应用版本、简短说明以及指向本网站的链接。
隐私与数据
dicto 在你的设备上处理一切。你所说或所输入的内容都不会发送给我们,关闭应用后也不会保存任何内容。完整详情请参见隐私政策。
支持
有疑问、遇到问题或想提供反馈?欢迎来信 support@speechdisplay.com,我们很乐意帮忙。