Nauka

Otwarty standard jakości wideo wyjaśniającego.

Przeczytaliśmy opublikowane badania na temat tego, jak ludzie uczą się z wideo, i zamieniliśmy ustalenia, które przetrwały weryfikację, na liczbowe zasady, których musi przestrzegać nasz generator. Oto cała specyfikacja, wraz z cytatami, z wyraźnie oznaczonymi rzeczami, których nie mogliśmy zweryfikować. Jest publiczna, ponieważ standard, którego nie można sprawdzić, nie jest standardem.

Jak to czytać

Każda zasada niesie swój stopień dowodu.

Każdy może twierdzić, że jest zbudowany na nauce. Oceniamy każde twierdzenie, abyś mógł odróżnić zweryfikowany efekt od działającego założenia. Uczciwość jest wiarygodnością.

Zweryfikowane Przeszło weryfikację adwersarialną wobec źródła pierwotnego.
Wyprowadzone Arytmetyczna konsekwencja zweryfikowanej zasady.
Heurystyczne Kanon praktyków lub ekstrapolacja zasad Mayera, niezweryfikowane w tej rundzie.
Produktowe Decyzja produktowa, nie twierdzenie badawcze.
Pipeline Zmierzona właściwość naszego własnego pipeline'u.
Część pierwsza

Jedenaście praw projektowania.

To, co nauka naprawdę mówi, z wielkościami efektów i linkiem do źródła pierwotnego dla każdego.

L1 Zweryfikowane

Stopniowe ujawnianie jest obowiązkowe i jest największą dźwignią, którą kontrolujemy.

Treść budowana kreska po kresce mierzalnie przewyższa pokazywanie ukończonych scen. Zapamiętywanie ηp²=0.13 to 0.17, transfer ηp²=0.10 to 0.16, powtórzone w dwóch eksperymentach z identyczną narracją.

W Sketchie: Nigdy nie przechodź od razu do ukończonego diagramu. Każdy element jest rysowany. To nie estetyka, to mechanizm zapamiętywania.

Źródło: PMC9898452
L2 Zweryfikowane

Widoczna dłoń jest opcjonalna. Rysunek nie.

Rysowanie ręką vs popychanie ręką vs brak dłoni zmieniło motywację wewnętrzną (p=0.033), ale nie dało różnicy w wynikach nauki.

W Sketchie: Pomijamy renderowanie dłoni i nie tracimy niczego mierzalnego. To samo rysowanie ma znaczenie.

Źródło: Smart Learn. Env. 2023
L3 Zweryfikowane

Sygnalizowanie kupuje zapamiętywanie i transfer poprzez zmniejszenie obciążenia poznawczego.

Metaanaliza, 32 badania, N≈3,597: wskazówki dają zapamiętywanie d=0.27, transfer d=0.34, obciążenie d=−0.11. Wielkość redukcji obciążenia przewiduje zysk w nauce (β=−0.70 zapamiętywanie, −0.60 transfer).

W Sketchie: Strzałki, akcenty kolorystyczne i ujawnianie etykiet to wskazówki, nie dekoracja. Każda wskazówka wskazuje to, co narracja mówi w danej chwili.

Źródło: PMC5576760
L4 Zweryfikowane

Segmentuj i pozostawiaj luki na przetwarzanie.

Metaanaliza segmentowania wykazała znaczące zyski w zapamiętywaniu i transferze, od małych do średnich. Część korzyści pochodzi z czasu przetwarzania, który tworzą granice.

W Sketchie: Sceny są segmentami. Po ostatnim ujawnieniu sceny narracja milczy przez co najmniej 0.7 sekundy przed cięciem.

Źródło: Rey et al. 2019
L5 Zweryfikowane

Sześciominutowe urwisko jest prawdziwe.

Na 6.9 miliona sesji edX zaangażowanie utrzymuje się blisko 1.0 poniżej 6 minut, spada do około 0.55 przy 9 do 12 minutach i spada do około 0.2 po 12 minutach. Niezależnie potwierdzone w replikacji z 2026 roku.

W Sketchie: Domyślny wynik to twarde 6:00. Dłuższe prośby stają się serią wideo podzieloną na rozdziały, nigdy jednym długim filmem.

Źródło: Guo et al. 2014
L6 Zweryfikowane

Rysowanie w stylu Khana przewyższa slajdy na każdej długości.

Około 0.72 vs 0.52 znormalizowanego zaangażowania przy 3 do 6 minutach, przypisywane ruchowi rysowania ręcznego plus improwizowanej, mówionej prezentacji.

W Sketchie: Format jest zwalidowany. Narracja powinna brzmieć jak mówiona, nie czytana. Skróty są dozwolone, bezpośrednie zwracanie się jest zachęcane.

Źródło: Guo et al. 2014
L7 Zweryfikowane

Narracja i stopniowe ujawnianie muszą być połączone.

Scenariusz narracyjny poprawił transfer (ηp²=0.12 to 0.20), ale nie zapamiętywanie samodzielnie. W POŁĄCZENIU ze stopniowym rysowaniem narracja przewyższyła informacyjny przekaz dla zapamiętywania (p=0.021). W przypadku obrazów STATYCZNYCH zwyciężył zamiast tego informacyjny scenariusz (η²=0.21 to 0.24).

W Sketchie: Nasze scenariusze używają gramatyki narracyjnej, aktora z celem, przeszkodą i rozwiązaniem, dokładnie dlatego, że zawsze renderujemy stopniowo. Nigdy narracja lektorska na statycznej klatce.

Źródło: PMC9898452
L8 Zweryfikowane

Żadnych uwodzicielskich szczegółów.

Interesująca, ale nieistotna treść nie poprawia nauki.

W Sketchie: Każdy element wizualny musi być przywołany przez narrację. Nieprzywołana dekoracja to porażka, nie polot.

Źródło: Mayer 2020
L9 Zweryfikowane

Zakończ generowaniem, nie tylko podsumowaniem.

Podpowiedzi, które zmuszają ucznia do podsumowania lub wyjaśnienia, poprawiają naukę. To zasada aktywności generatywnej.

W Sketchie: Każde wideo kończy się rytmem przywoływania: pojawia się pytanie, wideo pauzuje na 1.5 do 2 sekundy, a następnie jednolinijkowe podsumowanie.

Źródło: Springer 2020
L10 Zweryfikowane

Granice zdarzeń resetują uwagę.

Więcej punktów zmiany wizualnej i narracyjnej oznacza mniej błądzenia myślami.

W Sketchie: Zmiany scen to resety uwagi. Umieszczaj je na granicach pomysłów, nigdy w środku pomysłu.

Źródło: Nature HSSC 2026
L11 Zweryfikowane

Nie optymalizuj pod estetykę liczby wyświetleń.

Jakość wyjaśniania nie koreluje z wyświetleniami po kontroli wielkości kanału (r=0.23, nieistotne). Korelują tylko polubienia, istotne komentarze i interakcje.

W Sketchie: Oceniamy projekt nauki, nie sygnały wiralowości.

Źródło: arXiv 2207.05872
Część druga

Liczby, które musi osiągnąć pipeline.

Powyższe prawa stają się konkretnymi celami. To umowa, wobec której generator jest sprawdzany przy każdym renderowaniu.

Parametr Cel Ocena
Całkowita długość wideo twardy pułap 6:00; słodki punkt 1:00 do 3:00 na koncepcję Zweryfikowane
Granularność długości przyrosty 30-sekundowe Produktowe
Czas trwania sceny 12 do 30 sekund, jeden pomysł na scenę Zweryfikowane
Elementy na scenę 3 do 7 widocznych na koniec sceny, wliczając nagłówek Heurystyczne
Tempo ujawniania nowy element co 2 do 5 sekund; żadne dwa ujawnienia nie bliżej niż 1.2s Wyprowadzone
Synchronizacja ujawnienie-słowo element pojawia się w ciągu ±500ms od słowa wyzwalającego Wyprowadzone
Pokrycie synchronizacji słów co najmniej 95% elementów niesie słowo ujawniające, które się rozwiązuje Pipeline
Luka po scenie co najmniej 0.7s ciszy narracji po ostatnim ujawnieniu, przed cięciem Zweryfikowane
Styl ujawniania rysowanie konturu (0.3 do 0.5s), następnie stopniowane wypełnienie kolorem; strzałki od czubka do ogona Zweryfikowane
Widoczna dłoń brak Zweryfikowane
Etykiety trzy słowa lub mniej, słowo kluczowe wielkimi literami; nigdy zdanie odzwierciedlające narrację Heurystyczne
Tempo narracji 140 do 160 słów na minutę, rejestr mówiony, skróty dozwolone Heurystyczne
Struktura scenariusza hak w ciągu 10s, konkretna analogia, mechanizm, kotwica ze świata rzeczywistego, rytm przywoływania, podsumowanie Zweryfikowane
Gramatyka narracyjna aktor, cel, przeszkoda, rozwiązanie, kiedykolwiek pozwala na to domena Zweryfikowane
Analogia co najmniej jedna konkretna analogia przed pierwszym abstrakcyjnym terminem Heurystyczne
Nieistotne wizualizacje zero elementów nieprzywołanych przez narrację Zweryfikowane
Zakończenie pytanie przywołujące, pauza co najmniej 1.5s, następnie jednolinijkowe podsumowanie Zweryfikowane
Przejścia sceny twarde cięcie tylko na granicy pomysłu, nigdy w środku pomysłu Zweryfikowane
Część trzecia

Trójwarstwowy mechanizm oceny.

Zasada jest prawdziwa tylko wtedy, gdy można ją przetestować. Każde wideo przechodzi przez trzy warstwy, zanim zostanie dopuszczone do publikacji.

Layer A

Mechaniczna

Zwykłe asercje JavaScript na grafie sceny i czasach słów. Zerowy koszt, bezpieczne do uruchomienia w CI. Całkowity czas trwania poniżej pułapu, każda scena w swoim paśmie czasu trwania, 3 do 7 elementów na scenę, każdy element niesie słowo ujawniające, które mieści się w ±500ms od wypowiedzianego słowa, ostatnia scena z pytaniem i podsumowaniem, i żaden element nieprzywołany przez narrację. Zdaje lub nie, bez wywołań modelu.

Layer B

Semantyczna

Przejście modelu-jako-sędziego, ocenione od 1 do 5, próbkowane i uruchamiane przy wydaniu, nigdy w CI. Jeden pomysł na scenę, wierność ikon, czy analogia rzeczywiście odwzorowuje mechanizm, jakość haka, skan uwodzicielskich szczegółów i wierność dokumentowi źródłowemu. Każdy wymiar poniżej 3 kończy się niepowodzeniem bramki wydania.

Layer C

Weryfikacja wyjścia

Kontrole na samym wyrenderowanym pliku. Arkusz kontaktowy potwierdza brak nakładających się elementów i czytelne etykiety, seria klatek potwierdza, że ujawnienie kontur-potem-wypełnienie rzeczywiście występuje, a dźwięk jest znormalizowany pod względem głośności bez przyciętych zdań na cięciach.

Nie manifest, brama

Jak Sketchie to egzekwuje.

Specyfikacja ma wartość tylko wtedy, gdy wideo, które ją łamie, nie może zostać opublikowane. Warstwa A działa w momencie generowania, na grafie sceny, zanim wydamy choćby cent na głos lub renderowanie. Graf, który nie przechodzi kontroli mechanicznych, jest odsyłany do regeneracji z dokładnymi błędami wprowadzonymi do promptu. Graf, który wciąż zawodzi, nigdy nie staje się wideo.

Każda kontrola z powyższej listy odpowiada rzeczywistej asercji w naszym silniku: pułap całkowitego czasu trwania, pasmo czasu trwania na scenę, liczba elementów, wskaźnik rozwiązania słów ujawniających, cisza po scenie, zasady etykiet i zakończenie pytanie-plus-podsumowanie. Strzałki są również sprawdzane, więc wskaźnik nigdy nie przecina elementu, z którym nie jest połączony. Ten sam kod działa w bramce regeneracji workera i w ciągłej integracji, więc zmiana generatora, która cofnęłaby jakość, blokuje samą siebie.

Otwarty standard oceny na GitHub Przeczytaj źródło Warstwy A Get Started

Sketchie mascot

Zbudowane, aby być zapamiętanym.

Get Started