Das aktuelle System nutzt semantische Ähnlichkeit, um gute Kandidaten zu finden.
Als nächsten Schritt würde ich daraus einen hybriden Produktvergleich machen.
Technische Werte sollten zuerst in klare gemeinsame Formate gebracht werden. Zum Beispiel sollten Kilogramm und Tonnen am Ende als derselbe maschinenlesbare Wert vergleichbar sein.
Danach kann man Semantic Search mit festen technischen Regeln und gewichteten Attributen kombinieren.
Ein Produkt sollte nicht nur deshalb weit oben stehen, weil die Beschreibung ähnlich klingt, wenn ein wichtiger technischer Wert nicht passt.
Ich würde außerdem ein geprüftes Set mit bekannten Produktpaaren aufbauen. Damit könnte man messen, wie gut der Produktvergleich funktioniert, zum Beispiel wie viele der besten Treffer wirklich passen und wie viele relevante Produkte gefunden werden.
Auch beim Crawling würde ich die Herkunft und Änderungen der Daten besser speichern: Woher kommt ein Wert? Wann wurde er gelesen? Was hat sich seit dem letzten Crawl geändert? Wo hat sich die Struktur einer Quelle verändert?
So könnte das System leichter überwacht und verbessert werden.
Ein gutes Vergleichssystem findet Kandidaten. Ein zuverlässiges System zeigt auch, wie sicher diese Ergebnisse sind.