Dinoer

Eine Forschungskampagne über einem gesperrten Korpus durchführen

Eine Manifestdatei, eine Instanz von SearXNG und ein Bericht, der jeden Anspruch auf eine tatsächlich erfasste Seite zurückverfolgt. Zwei reale Kampagnen – was sie gefunden haben und welche Fehler sie gemacht haben, bevor diese behoben wurden.

Der Fall, auf den Dinoer selbst setzt: Untersuchen Sie ein Thema anhand öffentlich zugänglicher Quellen und liefern Sie einen Bericht, in dem jede Aussage auf eine Seite zurückverfolgt werden kann, die tatsächlich auf der Festplatte gespeichert ist – nicht auf das, was ein delegiertes Modell sich nur vage aus seinem eigenen Training oder, noch schlimmer, aus einer Live-Suche erinnert, die es eigentlich nie hätte durchführen sollen.

Eine territoriale Auflistung, aufgebaut von Grund auf

Eine echte Veranstaltungsübersicht (keine feste Anzeige): Finden Sie Konzerte und Veranstaltungen innerhalb von 30 km um eine benannte Stadt, über einen Zeitraum von zehn Tagen. Sechszehn Suchanfragen an SearXNG qualifizierten dreizehn Referenzdomains; campagne.py sammelte 43 Seiten von diesen, und die zielgerichtete Extraktion pro Quelle ergab 15 positive Ergebnisse, die auf 11 verschiedene Veranstaltungen in 9 Gemeinden reduziert wurden.

{"id_campagne": "spectacles-sud-finistere-2026-08-11-20",
 "cibles": [
   {"type": "query", "valeur": "concerts finistere sud ete"},
   {"type": "table_reference", "valeur": "mairies du Finistere sud",
    "cle_thematique": "mairies_finistere_sud"}
 ],
 "delai_min_secondes": 4.5, "delai_max_secondes": 8.5}

Ein echtes Problem trat beim tatsächlichen Betrieb auf, nicht bei der Überprüfung. Die Anti-Sperr-Verzögerung wurde zwischen den Abrufen gespeicherter Seiten angewendet, aber niemals zwischen den eigentlichen SearXNG-Abfragen. Eine schnelle Folge von sechzehn Suchanfragen führte dazu, dass die eigenen Upstream-Engines der SearXNG-Instanz diese sperrten. Das Problem wurde am selben Tag behoben, an jeder Stelle, an der eine Abfrage aufgerufen wird, und empirisch bestätigt, bevor die Korrektur als abgeschlossen galt.

Eine Reputationprüfung und die Disziplin, die sie überprüfbar machte

Eine zweite Kampagne, eine andere Art von Frage: drei offene query-Ziele zu einem konkreten Thema, 28 Seiten auf der leichten Stufe erhalten. Der synthetisierte Bericht wies korrekt auf eine Uneinigkeit zwischen Quellen bei einem sachlichen Punkt hin und schloss korrekt einen gleichnamigen Namensvetter aus, statt beide zu einer einzigen Antwort zu verschmelzen.

Verifiziert, nicht einfach im eigenen Bericht geglaubt: ein direkter Aufruf des vollständigen JSON-Ereignisstroms des delegierten Modells – nicht die zusammenfassende Hilfsfunktion, die nur den Endtext zurückgibt – bestätigte exakt drei Ereignisse für den gesamten Lauf (step_start, text, step_finish) und null tool_use-Ereignisse. Nichts verließ den Korpus während der Synthese. Genau diese Prüfung hatte das erste Mal, als diese Disziplin andernorts angewendet wurde, eine echte Lücke aufgedeckt – siehe Der Korpus ist das, was das delegierte Modell verlassen darf →.

Was eine offene Frage richtig beantwortete, was eine enge Frage nicht konnte

--extraire-cible "<demande>" kann jede Anfrage in natürlicher Sprache verarbeiten, nicht nur eine strenge Faktenabfrage. Bei der Referenzkampagne ermöglichte eine offene, beschreibende Frage dem delegierten Modell selbst zu beurteilen, ob es ein einmaliges Fakt oder ein mehrstufiges Ereignis las – 17 von 47 Anfragen wurden positiv bewertet und enthielten reichhaltigere Inhalte als eine engere Formulierung (trouve/valeur/url) auf demselben Korpus. Das Extraktionsrezept, vollständig →

Wo diese Angelegenheit endet

Der automatische Abschlussbericht ist ein Arbeitsentwurf – dateiweise verkettet, auf 60.000 Zeichen gekürzt, ohne Rangfolge, es sei denn, das Manifest enthält sujet_synthese. Was das kostet, gemessen →

Und selbst die Entdeckung hat eine echte Grenze: SearXNG, ohne Authentifizierung, erreicht nicht das, was ein kommerzieller Suchmotor mit Cookies erreicht. Worauf Dinoer keine Konkurrenz eingeht →