LearnAI
Новинки AI · Голосовой AI · Lekcja 5/10
← Do katalogu
Zadanie

Dekodowanie spotkania na tekst

Przygotuj prośbę o transkrypcję tego nagrania. Zwróć JSON {"glossary":["..."],"speakers":"...""output_needs":"..."}: słownik nazw/terminów informujący model o tym, jak oznaczyć głośniki i co jest potrzebne na wyjściu (kody czasowe, zaznaczanie niepewnych miejsc itp.).

Odblokuj dostęp, aby przesyłać rozwiązania do natychmiastowej oceny AI.
Dźwięk do czytelnego tekstu
💡 Kawałek teorii

Transkrypcja - rozszyfrowanie długiego nagrania na tekst. Pod maską modelka nie tylko rozpoznaje słowa, ale także stara się oddzielić mówiących (diaryzacja) i uporządkować czasy. Dokładność zależy od trzech czynników: nieznanych nazw i terminów, nakładającej się mowy (wzajemnie przerywającej) oraz mocnego akcentu lub hałasu. Stąd dźwignia. Pierwszym i najbardziej niedocenianym jest wyposażenie modelki w słowniczek: listę imion i nazwisk uczestników, tytułów, skrótów. Słowa „przedstawione” z wyprzedzeniem są rozpoznawane zauważalnie trafniej niż słowa odgadnięte od zera. Po drugie, poproś o oznaczenia według głośników i czasu, aby szybko znaleźć odpowiedni moment. Profesjonalny trik: jeśli wpis jest ważny, poproś o zaznaczenie niepewnych miejsc nawiasem lub znakiem – w ten sposób od razu zobaczysz, co należy sprawdzić, zamiast ufać gładkiemu, ale potencjalnie błędnemu tekstowi. Insider: 80% jakości transkrypcji zależy od jakości dźwięku wejściowego – jeden dobry mikrofon na środku stołu jest lepszy niż jakakolwiek obróbka końcowa. Typowym błędem początkujących jest opublikowanie dwugodzinnego nagrania bez jednej nazwy i kontekstu, a następnie ręczne usunięcie dziesiątek błędów.

Jak jest oceniane · zaliczenie 70

  • 1Prawidłowy JSON bez tekstu wokół niego30%
  • 2Istnieją pola glossary, speakers, output_needs25%
  • 3Słowniczek, prelegenci i notatki są ustawione45%
Twoja zachętaClaude ⌄
🔒

Odblokuj dostęp, aby przesyłać rozwiązania do natychmiastowej oceny AI.