Benchmark

Lokalne modele zostawiają zadania, które spotkanie odwołało

Pomiar z 10 i 14 września 2026 na ścieżce przetwarzania ScreenBrief. Artflow Management.

Poprosiliśmy trzy modele działające lokalnie w Ollamie, żeby wyciągnęły z krótkiego spotkania decyzje, zadania i uczestników. Spotkanie było napisane z pułapkami: zadanie odwołane minutę później, przesunięta data, osoba wspomniana, ale nieobecna. Modele wpadły prawie we wszystkie, a ostrzejszy prompt ich z tego nie wyciągnął.

Krótka odpowiedź

Na dziewięć przebiegów wycofane zadanie zostało na liście w 8. Uczestników po imieniu rozpoznano w 8 na 27 możliwych trafień.

Jedna dodatkowa reguła w prompcie naprawiła wycofane zadanie w jednym modelu z trzech. Deterministyczny krok uruchamiany po modelu, na jego odpowiedzi, usunął je w 9 przebiegach na 9 i nie zgubił ani jednego prawdziwego zadania. Podawanie imion mówców nadal jest otwartym problemem.

Jak mierzyliśmy

  • Modele: qwen3:8b, qwen2.5:7b, qwen3-vl:4b, czyli te trzy zainstalowane na maszynie testowej. To nie jest przegląd rynku modeli.
  • Opcje Ollamy jak w aplikacji: num_ctx 8192, num_predict 1000, bez strumieniowania. ollama ps potwierdził pełny kontekst i 100% na GPU.
  • Temperatura domyślna Ollamy, bo aplikacja jej nie ustawia. Każdy model szedł trzy razy na identycznym wejściu, a rozrzut między przebiegami jest częścią wyniku.
  • Prompt to ten sam, który ScreenBrief wysyła po zadania i decyzje, czytany z kodu aplikacji w chwili uruchomienia, więc benchmark nie rozjedzie się z produktem.
  • Wejście: syntetyczne spotkanie, 322 sekundy, trzech mówców, zero danych osobowych. Ocena to reguły słów kluczowych dla każdej oczekiwanej pozycji; to, co nie pasuje do żadnej reguły, liczymy osobno i czyta człowiek, zamiast doliczać jako błąd.

Pułapki

  • Wspomniany, ale nieobecny. Daniel z działu prawnego jest cytowany i nigdy nie mówi. Nie może trafić na listę uczestników.
  • Odwrócona decyzja. Beta ma wyjść dziewiętnastego, potem zostaje przesunięta na dwudziestego szóstego. Decyzją jest tylko dwudziesty szósty.
  • Wycofane zadanie. Maya dostaje polecenie napisania do dostawcy, a minutę później okazuje się, że dział prawny już to zrobił, więc zadanie zostaje odwołane. Nie może pojawić się na liście zadań.

Surowa odpowiedź modeli

Po trzy przebiegi na model, za każdym razem ta sama transkrypcja. Zakresy pokazują rozrzut między przebiegami.

ModelUczestnicyDecyzjeZadaniaZostawił wycofane zadaniePrzesuniętą datę podał jako decyzjęMediana czasu
qwen3:8b0/34/43-4/43 na 3 przebiegi3 na 3 przebiegi4,6 s
qwen2.5:7b0-2/33-4/40-2/42 na 3 przebiegi0 na 3 przebiegi3,9 s
qwen3-vl:4b0-3/33-4/43/43 na 3 przebiegi0 na 3 przebiegi3,3 s

Rozrzut w obrębie jednego modelu był większy niż różnice między modelami: qwen2.5:7b zaliczył kolejno 7, 6 i 3 z 11 trafień na tym samym tekście. Benchmark lokalnych modeli z jednym przebiegiem na model mierzy głównie szum.

qwen3:8b ani razu nie podał imienia i odpowiadał Speaker A/B/C, choć prompt wprost tego zabrania.

Co dała jedna reguła w prompcie

Dopisaliśmy do promptu zdanie: If a task or a decision is later withdrawn, cancelled or superseded anywhere in the transcript, do NOT report it: report only what still stands at the end of the recording.

ModelWycofane zadanie, bez regułyZ regułą
qwen3:8b3 na 33 na 3
qwen2.5:7b2 na 30 na 3
qwen3-vl:4b3 na 33 na 3

8 na 9 spadło do 6 na 9. Reguła pomogła jednemu modelowi, pozostałych dwóch nie ruszyła. Przy trzech przebiegach i domyślnej temperaturze widać tylko duże efekty, więc to przesłanka, nie dowód, ale wniosek praktyczny się utrzymał: odwołania nie da się pewnie załatwić jedną linijką promptu.

Co to naprawiło

Deterministyczny krok po modelu. Szuka w transkrypcji sygnałów odwołania, takich jak „nieważne”, „skreślcie to” czy „drop it”, i usuwa zwrócone zadanie tylko wtedy, gdy słowa wokół sygnału dotyczą tego zadania. Te same dziewięć zapisanych odpowiedzi modeli przepuściliśmy przez niego dokładnie tak, jak wywołuje go ścieżka przetwarzania.

MiaraWynik
Ocenione przebiegi9
Wycofane zadanie w surowej odpowiedzi modelu9 na 9
Wycofane zadanie po sprawdzeniu0 na 9
Przebiegi, w których zginęło prawdziwe zadanie0 na 9

Pierwsza wersja nie była tak czysta. W 4:54 pada zdanie „Keep it for two weeks read only, then drop it. Maya, fold that into the migration.” Słowa „drop it” dotyczą tu tabeli w bazie, a nie zadania, i w jednym przebiegu krok usunął prawdziwe zadanie migracji. Teraz zdanie, które zaraz po sygnale przekazuje pracę konkretnej osobie, podtrzymuje zadanie przy życiu, a tabela wyżej to wynik po tej zmianie.

Ten krok naprawia wycofane zadanie i tylko to. Nie sprawia, że modele podają imiona; to zostaje otwarte.

Ograniczenia, które trzeba podać

  • Trzy modele, jedna angielska transkrypcja, jedna maszyna, po trzy przebiegi.
  • Transkrypcja jest syntetyczna i czysta. Prawdziwe spotkania dokładają przerwania, szum i błędy transkrypcji, więc to mierzy rozumowanie na uporządkowanym tekście.
  • Ocena słowami kluczowymi zaniża wynik modelu, który opisze właściwą pozycję nietypowymi słowami. Dlatego pozycje bez dopasowania liczymy osobno i czytamy ręcznie.
  • Żaden model chmurowy nie przeszedł jeszcze przez ten sam test, więc nic tu nie mówi, jak wypada model w chmurze.

Dane, żeby można było to sprawdzić

Pełne wejście jest opublikowane: syntetyczna transkrypcja z pułapkami opisanymi w samym pliku oraz wzorzec z regułami oceny. Oba pliki to zwykły JSON, po angielsku. Puść je przez własny model i prompt i sprawdź, czy wycofany mail do dostawcy przetrwa.

Zobacz, co wychodzi z Twoich spotkań

Pierwsze 5 transkrypcji jest za darmo. Transkrypcja działa na Twoim komputerze, a streszczenia mogą korzystać z lokalnej Ollamy albo Twojego dostawcy AI.

Pobierz z Microsoft Store

Windows 10/11 · darmowe pobranie

Pomiar na ścieżce przetwarzania ScreenBrief według stanu z 14 września 2026. Szczegóły obsługi danych: polityka prywatności.