准备一份转录此录音的请求。返回 JSON {"glossary":["..."],"speakers":"...","output_needs":"..."}:一个名称/术语词汇表,告诉模型如何标记说话者,以及输出中需要什么(时间代码、标记不确定的地方等)。
转录 - 将长录音破译为文本。在底层,该模型不仅识别单词,还尝试分离说话者(二值化)并安排时态。准确性取决于三件事:不熟悉的名称和术语、重叠的语音(互相打断)以及浓重的口音或噪音。因此杠杆作用。第一个也是最被低估的一个是提前给模型一个术语表:参与者姓名、标题、缩写的列表。提前“呈现”的单词比从头开始猜测的单词被识别得更准确。其次,询问发言人和时间的标记,以便您可以快速找到合适的时刻。专业技巧:如果条目很重要,请要求用括号或符号标记不确定的地方 - 这样您就可以立即看到要仔细检查的内容,而不是相信流畅但可能错误的文本。业内人士:转录质量的80%取决于输入声音的质量——桌子中央的一个好的麦克风比任何后期处理都要好。一个典型的初学者错误是在没有单一名称或上下文的情况下发布两小时的录音,然后手动清除数十个错误。
解锁提交解决方案以供即时 AI 审核的权限。